2026-08-07
扫描范围:过去 24 小时(截至 2026-08-07 17:33,Asia/Shanghai)
🎬 YouTube
1. Web Agent 的细粒度规划能力评测
Y Combinator 介绍一项针对 Web Agent 规划能力的评测研究,重点不只是看代理最终有没有完成任务,而是检查中间步骤是否合理、细粒度决策是否可靠。这类评测有助于区分“偶然走通流程”和“真正具备可迁移规划能力”,对浏览器代理的训练与验收都很关键。
2. 关系数据库的零样本预测模型
视频讨论如何让模型在未针对目标数据库专门训练的情况下,直接对关系型数据执行预测。核心挑战在于理解表结构、主外键关系和跨表信号;若能稳定泛化,可显著降低企业为每个数据集单独建模的成本。
3. ChartNet:训练视觉语言模型理解图表
ChartNet 聚焦图表理解,要求视觉语言模型同时识别坐标轴、图例、数据点及它们之间的数量关系。相比普通图片问答,这类任务更强调精确读数和结构推理,可用于报表分析、研究资料阅读与自动数据核验。
4. Diamond Maps:生成模型的高效奖励对齐
视频介绍 Diamond Maps,一种面向生成模型奖励对齐的方法,关注如何更高效地把人类偏好或任务目标转化为训练信号。它对应的现实问题是:奖励模型成本高、反馈稀疏,并且容易让生成模型针对评分机制“投机”。
5. 视频 Agent 的任意时间跨度推理
这项工作研究视频 Agent 如何跨不同时间尺度推理:既要捕捉短时动作,也要理解长视频中的因果链和任务进展。“任意跨度”能力对视频检索、操作指导和长流程自动化尤其重要,因为关键证据可能相隔很远。
🎙️ 播客
1. No Priors:万亿美元公司、创始人野心与 Token 预算
Sarah Guo 与 Elad Gil 从“万亿美元公司”的尺度讨论 AI 创业者该如何设定 ambition,并把 Token 预算视为产品能力与成本结构的核心变量。节目还涉及监管俘获:成熟企业可能利用规则提高新进入者门槛,创业者需要同时判断技术窗口、资本强度与政策风险。
RSS 本次未提供单集直链。
📝 博客
1. Datasette 1.0a38 修复 SQL 注入漏洞
Datasette 1.0a38 修复了一个会影响“同一数据库同时开放公开表和私有表”配置的 SQL 注入问题。此前,能访问公开表的用户可能绕过 execute-sql 权限限制,以只读方式访问同库私有表;使用这类混合权限配置的管理员应尽快升级。
2. Datasette 0.65.3 回移同一安全修复
0.65.3 将 1.0a38 的 SQL 注入修复回移到旧稳定分支,适合暂时无法迁移到 1.0 预览版的部署。漏洞影响条件较窄,但一旦实例在同一数据库中混合公开表与私有表,潜在后果是私有数据被越权读取。
3. Simon Willison 谈技术写作
Simon 回顾了自己为何开始并持续写技术博客,以及写作对职业与社区影响的意外回报。他最直接的建议是“降低发布标准”:在仍对文章不完全满意时就发布,否则完美主义只会制造一个永远不会公开的草稿箱。
4. Gary Marcus:为什么不能低估 Google
Gary Marcus 从七个角度论证 Google 虽然承受 AI 竞争压力,但仍拥有模型研究、算力基础设施、分发渠道、数据和现金流等多重筹码。文章的判断不是 Google 已经胜出,而是其纵向整合能力和长期研发储备,使它仍具备重新取得主动权的条件。
5. OpenAI 设备据称是售价超 300 美元的环形音箱
Mark Gurman 的报道将 OpenAI 的硬件描述为一款环形音箱,预计售价超过 300 美元。若这一形态落地,它更像面向环境交互的常驻语音入口,而非传统屏幕设备;真正的差异化将取决于代理能力、隐私设计和持续服务成本。
6. OpenAI 提交 28 页动议,请求驳回 Apple 的诉讼
OpenAI 向法院提交了一份 28 页的驳回动议,正式挑战 Apple 诉讼中的法律主张。该文件本身是程序性诉讼材料,当前更值得关注的是法院是否认为 Apple 的指控已经达到继续进入证据开示阶段的门槛,而不是把动议视作案件胜负已定。
🗞️ Techmeme 热点
1. Google AI 重组强化 Sergey Brin 的影响力
消息称,Google 酝酿数月的 AI 组织调整正在落地,部分高管对 Demis Hassabis 的领导方式感到不满。此次变化被视为 Sergey Brin 在公司 AI 战略中影响力进一步增强的信号。
2. 前 a16z 合伙人筹建 Mido Capital
文件显示,前 a16z 合伙人 Bryan Kim 正在组建 Mido Capital;知情人士称其计划募资约 1 亿美元。基金将主要投资早期 AI 及其他初创企业。
3. 字节跳动据称预训练最高 10 万亿参数模型
消息称,字节跳动正在预训练一个最高达 10 万亿参数的 AI 模型,规模约为 Kimi K3 的三倍,也高于外界对 Anthropic Mythos 5 的 8 万亿参数估计。参数规模并不直接等于能力,但显示头部实验室仍在推进超大规模训练。
4. AI 数据中心公司 Firmus 融资 20 亿美元
悉尼 AI 数据中心公司 Firmus 从 Coatue、Nvidia 等投资者处融资 20 亿美元,投后估值达到 105 亿美元。其估值较今年 4 月的 55 亿美元接近翻倍,反映资本仍在重仓 AI 算力基础设施。
5. AI Agent 基础设施公司 Naïve 完成 2850 万美元 A 轮
Naïve 为 AI Agent 承担企业运营任务提供基础设施,本轮由 Nexus 领投 2850 万美元,累计融资达到 3200 万美元。融资说明市场正从单一 Agent 应用继续向权限、编排和业务系统连接等底层能力延伸。
📊 YouTube 5 条 | 播客 1 条 | 博客 6 条 | Techmeme 5 条 | 精选 17 条