2026-08-02
扫描范围:过去 24 小时
🎬 YouTube
采集到 1 条新视频,但页面详情与正文抓取失败,无法生成可靠的具体摘要,按规则未纳入精选。
🎙️ 播客
无近期更新。
📝 博客
1. AI 发展公开信之争:开放权重、蒸馏与前沿模型治理
Simon Willison 梳理了近期三组立场鲜明的公开信。微软牵头、235 家机构签署的信主张开放权重有助于审计、竞争和降低单点风险,并明确为模型蒸馏辩护;Anthropic 则强调开放权重可能放大网络与生物安全风险,主张打击工业规模蒸馏。另一封由 1,324 名前沿 AI 公司员工签署的信,呼吁国际合作建立工具,对自动化 AI 研发带来的加速进行有意节奏控制。
2. Simon Willison 2026 年 7 月 AI 月报目录
本期月报覆盖 OpenAI 与 Anthropic 测试模型引发的意外网络攻击、GPT-5.6 Sol/Terra/Luna、Claude Opus 5、Kimi K3、DeepSeek-V4-Flash-0731,以及关于 AI 开放发展的公开信。它还收录了 MCP 的重新升温、其他模型发布、Simon 的个人项目与近期工具栈;全文属于赞助者内容,公开页面提供了主题目录。
3. Greg Brockman:不要让 AI 成为人与人之间的隔离层
Greg Brockman 观察到,OpenAI 内部有人把 ChatGPT 接入 Slack 后,让代理代自己向同事求助;同事往往不喜欢被代理联系,即使本人直接开口时他们愿意帮忙。这说明协作的价值不只在任务完成,也在人际关系本身;AI 更适合把时间还给人、增强共同相处,而不是替人进行关系互动。
4. datasette-apps 0.2a0:让代理在不可见 iframe 中自动验收应用
新版本为 Datasette Agent 增加 app_debug() 和 app_list():前者可打开应用并执行 JavaScript 做烟雾测试,后者让代理找到用户有权编辑的应用。app_debug() 把应用放进不可见、不可交互的沙箱 iframe,代理仍能检查功能、测量元素尺寸;底层使用 datasette-agent 0.4a0 新增的 context.browser_task() 机制。
5. OpenAI Astra 攻克十个长期数学与理论计算机问题
OpenAI 让下一代大模型 Astra 的内部版本尝试十个至少十年没有主结果进展的问题,并称每题按 GPT-5.6 Sol 价格计算的成本低于 2,000 美元。其 openai/ten-proofs 仓库提供 Lean 4 形式化结果,另有论文和模型根据未公开推理轨迹重建证明过程的 PDF;Simon 认为透明度不错,但仍希望看到完整提示词与失败尝试数量。
6. 企业为何对 AI 成效集体撒谎
Cory Doctorow 转述 Nikhil Suresh 对大型企业 AI 项目的观察:晋升、预算和组织声誉都与“信仰 AI”绑定,导致董事会、管理层、员工和供应商共同夸大成效,甚至用 token 消耗量等可操纵指标考核。文章认为,AI 对有经验、能判断输出质量的“半人马型”个人工作者可能很有价值,但由管理层强推、以裁员和百倍效率为目标的自动化,往往掩盖了企业本就糟糕的软件项目与流程文档能力。
🗞️ Techmeme 热点
1. 菲尔兹奖得主 Jacob Tsimerman 将加入 OpenAI 从事 AI 安全
上周获得菲尔兹奖的多伦多大学数学家 Jacob Tsimerman 将暂时离校加入 OpenAI,研究 AI 安全。这再次显示前沿实验室正在吸引顶尖纯数学人才,把理论能力引入模型可靠性与安全研究。
2. 苹果限制漏洞报告:AI 辅助提交造成报告洪水
苹果为漏洞报告设置提交上限与 30 天冷静期,理由是 AI 辅助生成的报告激增;研究人员可申请提高额度。事件反映生成式 AI 降低了报告生产门槛,也把去重、验证和低质量噪声的成本转移给安全响应团队。
3. AI 算力扩张:在用芯片数量或每九个月翻倍
《纽约时报》梳理未来几年将上线的 AI 计算能力;Epoch AI 预计,在用 AI 芯片数量大约每九个月翻一倍。快速扩容会继续推高数据中心、电力、网络与供应链需求,也让训练规模和资本门槛同步上升。
4. OpenAI 称 Astra 在十个数学与理论计算机问题上取得结果
OpenAI 表示,下一代大模型 Astra 的内部版本在数学、量子复杂性和理论计算机科学的十个问题上产出了结果。相关成果配有论文和 Lean 4 形式化证明,但外界仍需进一步核验方法、提示词、失败率与独立复现情况。
5. 联合国峰会上,中国代表团力推开源 AI 模型
在联合国 AI for Good 峰会上,中国大型代表团主张,中国开源 AI 模型会成为全球多数地区的未来选择,而美国的现场存在感相对较弱。焦点已不只是单个模型能力,也包括开放生态、部署成本和全球技术影响力的竞争。
📊 YouTube 0 条 | 播客 0 条 | 博客 6 条 | Techmeme 5 条 | 精选 11 条