Teigen's Daily
X Digest · 🐦 X 简报

2026-07-03

🤖 AI/ML

  • @polynoamial:英国 AI Security Institute 的新研究把“测试时算力预算”纳入前沿模型评测,说明模型能力评估不能只看静态基准,还要看推理预算如何改变结果。🔗 链接
  • @SakanaAILabs:Sakana AI 在 ICML 2026 展示“Bridging Spherical Black-Box Optimizers”,聚焦无梯度模拟器、外部 API 和强化学习场景里的黑盒优化,是自动化研究和 agent 调参的底层能力。🔗 链接
  • @quxiaoyin:曲晓音指出美国缺少强开源模型会迫使企业在中国模型和 OpenAI/Anthropic 之间二选一,这把模型主权、商业信任和开源生态拉到同一个战略问题里。🔗 链接
  • @vista8:Claude Science 开始测试,面向科研全流程提供代码追溯、可管理运行环境和 60 多个科学数据库连接,说明大模型产品正在从通用聊天转向垂直工作台。🔗 链接
  • @vista8:Google 发布 Nano Banana 2 Lite 和 Gemini Omni Flash,前者主打 4 秒内低价生成 1K 图片,后者按秒计费生成媒体,AI 媒体模型的价格和延迟竞争继续下探。🔗 链接
  • @Azaliamirh:一项面向 AMD HIP 内核的合成数据/RL 方法把 KernelBench L2 正确率从 6% 拉到 60%,低资源系统编程语言也开始吃到自动优化红利。🔗 链接
  • @alex_prompter:Alex Prompter 提醒 Fable 5 遇到网络安全、生物、化学等任务可能被安全分类器静默路由到 Opus 4.8,真正用好高价模型需要记录响应模型并按任务路由。🔗 链接
  • @willdepue:Will Depue 把各类个人数据导出成 300k token 的 PersonalOS 上下文包,用于记忆、照片转写和个人财务等场景,个人 AI 的重点正在从聊天转向私有上下文操作系统。🔗 链接
  • @willdepue:Will Depue 向 Claude Code 和 Codex 团队要一个常驻、可信、会主动发短信沟通的 executive super assistant,这条需求清单很好地概括了下一代个人 agent 的产品缺口。🔗 链接
  • @levie:Aaron Levie 强调企业 AI 真正落地不只是接入聊天机器人,而是要把 AI 系统嵌入原本并非为 agent 设计的业务流程,这是企业应用层的核心难点。🔗 链接
  • @lennysan:Lenny 转述 OpenAI Codex app lead 的观点:AI 让人人能写代码不等于可以取消产品岗位,产品纪律里沉淀的试错经验不会因为“会 build”自动消失。🔗 链接
  • @emollick:Ethan Mollick 认为模型在不可验证领域也在变强,能力边界虽仍参差但没有“只有可验证任务才进步”那么简单,这对教育、创意和管理场景很关键。🔗 链接
  • @Hesamation:OpenAI 被曝已公布 Jalapeño AI 芯片、Anthropic 也在自研芯片,模型竞赛正在继续向算力供应链和芯片主权延伸。🔗 链接

💻 Tech

  • @yihui_indie:Yihui 用视频产品封面举例说明独立开发者必须深度使用自己的产品,因为“首帧当封面”这种看似合理的实现,真实体验里可能远不如自动抽帧打分。🔗 链接

🌐 其他热点

  • @immersivetran:Turnberry 协议过审后,美欧贸易并未回到自由贸易叙事,而是进入以关税上限、白名单和金属高税率为核心的防御性存量博弈。🔗 链接

📊 扫描 259 条 | 覆盖 24.5h | 精选 15 条

同日其他 — 2026-07-03
J 更早   K 更新   G 归档   / 主题