2026-08-22
🎬 YouTube
无近期更新。本轮发现的 2 条候选均因详情抓取失败而跳过,未使用仅凭标题生成的摘要。
🎙️ 播客
Simulation:新的 Scaling Law — Joon Sung Park,Simile AI
Simile 正在把 2023 年 Generative Agents / Smallville 的研究推进为“人类行为基础模型”:结合长访谈、观察与交易数据、随机对照试验,对个体与群体进行建模。节目称其数字孪生在复现 1,000 名真实受试者的行为和态度时,准确度达到人类自我复现水平的 85%;公司目前每周采集数万人的数据,并通过合作面板覆盖全球数千万人。Joon 认为仅靠提示词无法补齐“社会物理学”,模型还需要通过后训练学习人类的偏差、非理性和具体生活习惯,长期目标是模拟全球 80 亿人的社会涌现行为。
📝 博客
llm 0.32.1
LLM 的全新安装近期失效,原因是 OpenAI Python 库不再依赖 httpx,暴露了 LLM 一直通过传递依赖获得该库的问题。0.32.1 暂时将 OpenAI 库固定在 openai<3;即将发布的 0.33 则计划从 httpx 切换到 httpx2。
llm-openrouter 0.7
该版本完成对 LLM 0.32 的适配,并能展示 OpenRouter 模型返回的推理轨迹。插件改用 OpenRouter 的 Responses API,同时新增 Shell、WebFetch 和 WebSearch 三种服务端工具,可通过类似 -T WebSearch 的参数启用。
别再只做 TUI 了
Thomas Ptacek 主张把个人使用的临时 CLI 也做成原生图形界面,因为编码智能体已把做出“够用 GUI”的成本压得很低。Simon Willison 以自己长期使用的 macOS 菜单栏带宽和 GPU 监控应用为例,认为把一次性命令行工具升级为原生 UI,可能会改变开发者设计个人软件的方式。
ChatGPT 作为交互式导师:用四元数完成 AR 功能
Matt Webb 为 Galactic Compass 2 增加 AR 模式时,需要自己实现旋转计算;他没有让 ChatGPT 直接写代码,而是让它逐步讲解四元数。此前读书和请教数学朋友都没能解决的问题,通过耐心的交互式辅导终于学到足以完成应用的程度;他的结论是,把部分思考外包给 AI 不一定停止学习,也可能推动更深入的学习。
仅靠羞辱“AI 垃圾”阻止不了大型 AI 公司
Anil Dash 认为,对 AI 生成内容附加污名,最多让用户更沉默,并不会让平台失去用户或利润;Facebook 和 Uber 都表明,科技公司早已把短期羞耻成本计入商业模型。更有效的路径是提供积极替代方案:建设由社区掌控、尊重隐私与环境、能帮助普通人创作并进入真实社群的工具。批评者若更在意改变权力结构而非“骂赢”,就需要持续倾听用户、组织直接行动,并把现有替代产品明确带到人们面前。
🗞️ Techmeme 热点
开源模型追赶闭源模型的速度持续加快
SemiAnalysis 的观察显示,从早期规模扩展、推理模型到智能体时代,开源模型追上首个闭源领先模型所需的时间,每进入一个新阶段大约缩短一半。这意味着闭源厂商的技术领先窗口正在快速收窄。
OpenAI 总裁 Greg Brockman 权责扩大
在多名高管离职后,Greg Brockman 的职责显著扩大,开始同时掌管 OpenAI 的产品与规模扩展团队。调整把产品落地和基础设施扩张的关键决策进一步集中到其领导范围内。
OpenAI 要求加州扩大 SB 53 的前沿模型保障范围
OpenAI 建议加州修订 SB 53,把安全监测扩展到仍处于训练阶段的前沿模型。该主张出现在 AI 智能体攻击事件之后,重点是把监管和风险发现提前到模型发布之前。
Nvidia 的 AVO 在 ARC-AGI-3 公共集取得满分
Nvidia 称其通用编码智能体系统 AVO 在 ARC-AGI-3 公共集的 25 个环境中全部达到 100%,完成了全部 183 个关卡。该结果指向编码智能体在跨环境规划与工具使用任务上的新进展,但仍需关注公共测试集之外的泛化表现。
Anthropic 延揽前 Google TPU 负责人推进自研芯片
Anthropic 聘请 Amir Salek 加入计算团队;他曾在 2022 年前负责 Google 的 TPU 业务。此次任命被视为 Anthropic 推动自研芯片、降低对外部算力供应链依赖的一部分。
📊 YouTube 0 条 | 播客 1 条 | 博客 5 条 | Techmeme 5 条 | 精选 11 条