Teigen's Daily
AI Daily · 🤖 AI 信息源

2026-07-09

🎬 YouTube

无近期更新。

🎙️ 播客

Why AI Infrastructure must evolve for Agent Experience — Akshat Bubna, Modal CTO

Latent Space 这期请到 Modal CTO Akshat Bubna,主题是 AI 应用为什么正在把云基础设施从“开发者体验”推向“Agent Experience”。文章提到 Modal 刚完成 3.55 亿美元 C 轮,正在围绕 elastic inference、sandboxes、GPU burst、post-training、后台 agent 和 agent 可操作的基础设施重塑云平台。重点很实用:agent 需要能写代码、运行、看输出、改环境、调试、再迭代,传统 Kubernetes/YAML/仪表盘式云体验对 agent 并不友好。🔗 链接

📝 博客

Rewriting Bun in Rust

Simon Willison 摘要了 Jarred Sumner 关于 Bun 从 Zig 重写到 Rust 的长文,把它视为一次“agentic engineering”的高质量案例。核心不是简单换语言,而是利用 TypeScript 测试套件作为 conformance suite,让 agent harness 自动推进大规模移植,并通过 adversarial review、试运行和修生成流程来建立信心。数据很夸张:预合并阶段消耗约 59 亿 uncached input tokens、6.9 亿 output tokens、720 亿 cached input token reads,按 API 价格约 16.5 万美元;Claude Code 2.1.181 起已使用 Rust 版 Bun,Linux 启动快了约 10%。🔗 链接

Introducing GPT-Live

Simon 记录了 OpenAI 新语音模型 GPT-Live 的体验:ChatGPT 语音模式终于从 GPT-4o 时代模型升级,新模型可以在需要搜索、深度推理或复杂任务时,把工作委派给后台的 frontier model。发布时后台使用 GPT-5.5,语音对话本身仍能继续保持流动。Simon 的观察点很有意思:旧语音模式因为模型过时已经不太适合 brainstorming,新版本明显更强,但 preview 期间曾有“打断并笑”的交互问题,反馈后似乎已被调轻。🔗 链接

A quote from Kenton Varda

Kenton Varda 宣布团队暂停使用 AI 生成 PR、commit message、issue/ticket 等变更说明。原因是 AI 写出的描述对 reviewer “比没用还糟”:它会复述代码里一眼能看到的细节,却遗漏真正需要人类说明的高层上下文。这个提醒很关键:AI 可以帮写材料,但变更说明的价值在于解释“为什么”和“整体在做什么”,不是替 diff 做低质量旁白。🔗 链接

Writing an LLM from scratch, part 34b — from bigrams to GPT-2, one component at a time (in JAX)

Giles Thomas 这篇是他“从零写 LLM”长系列的收官篇:他不用书和旧 PyTorch 代码,只凭自己的笔记,用 JAX 逐步搭出 GPT-2 small 规模模型并从零训练。最终训练在 RTX 3090 上跑了 37 小时 15 分钟,还是 full 32-bit;相比他之前 PyTorch 版本的 40 小时 38 分钟更快。测试集 loss 为 3.418784,优于他 PyTorch 模型的 3.538161,也优于原始 GPT-2 small 在同数据集上的 3.499677,不过 OpenAI 权重在指令微调挑战里仍更稳定。🔗 链接

The hidden variables in your agent eval

Microsoft 的 Agent Experience 系列第七篇讨论 agent eval 的“隐藏变量”:即使固定模型、harness、prompt、workspace 和 extension,不同机器或不同时间跑同一 eval 仍可能得出不同结果。文章强调,环境因素会悄悄影响 agent 行为,而很多 eval 默认没有控制这些变量。它接续上一篇“公开 benchmark 不能告诉你哪个模型最适合你的 stack”的论点,进一步提醒团队做自有 eval 时要把可复现性当成核心工程问题。🔗 链接

🗞️ Techmeme 热点

AI 数据中心热潮推高电力变压器需求

Financial Times 报道,AI 数据中心建设让电力变压器需求激增,订单交付周期从过去按月计算拉长到按年计算。这个瓶颈说明 AI 基础设施扩张已经不只是 GPU 或机房问题,而是深入到电网设备供应链。🔗 链接

企业内部“AI champions”正在成为采用 AI 的组织机制

Wall Street Journal 报道,越来越多公司在内部组织“AI champions”推动落地;BCG 数据称,一线员工经常使用 AI 的比例从 2025 年的 51% 升至 74%。这说明企业 AI 采用开始从工具采购转向组织动员,关键变量变成培训、场景发现和内部传播。🔗 链接

Cognition 发布 SWE-1.7

Cognition 发布 SWE-1.7,称该模型基于 Kimi K2.7 训练,吞吐可达 1000 tokens/second,并声称在 benchmark 上接近 GPT-5.5 和 Opus 4.8,同时成本更低。值得关注的是它继续把竞争焦点放在软件工程任务的速度、成本和可用性上。🔗 链接

OpenAI 撤回对 SWE-Bench Pro 的推荐

OpenAI 表示在 SWE-Bench Pro 中发现大量任务问题,估计约 30% 的任务是 broken 的,并撤回此前推荐采用该 benchmark 的建议。这是 agent/code benchmark 可信度的一次明显警示:评测集本身的任务质量会直接扭曲模型比较结果。🔗 链接

OpenAI 推出 GPT-Live 语音模型

OpenAI 推出 GPT-Live,一代基于 full-duplex 架构的新语音模型,意味着模型可以同时听和说。ChatGPT Voice 将使用 GPT-Live-1 服务 Go、Plus、Pro 用户,免费用户默认使用 GPT-Live-1 mini;这和 Simon 的体验文互相印证,语音助手正在从“问答模式”走向更连续的实时对话。🔗 链接

📊 YouTube 0 条 | 播客 1 条 | 博客 5 条 | Techmeme 8 条 | 精选 11 条

同日其他 — 2026-07-09
J 更早   K 更新   G 归档   / 主题