X Digest · 🐦 X 简报
2026-07-18
SAT · July 18, 2026
二〇二六年七月十八
🤖 AI/ML
- @OpenAI:GPT-5.6 Sol 在“The Last Ones”网络靶场刷新最强成绩,并已通过 Codex Security 用于真实代码的漏洞发现、验证与修复,说明前沿模型的网络安全能力正从榜单走向防御生产环境。🔗 链接
- @steipete:真实 issue/代码审查评测中,Terra high 比 Sol low 快约 40%、10 个任务全部更快且避免了一次误关真实 bug,提醒工程选型应看具体工作流而非总榜排名。🔗 链接
- @SakanaAILabs:新研究让严格遵循生物神经元兴奋/抑制约束的网络无需权重反传也能完成分类与强化学习,为更具生物合理性的学习规则提供了可行路径。🔗 链接
- @karinanguyen:DiligenceBench 显示金融研究中强模型主要受益于通用执行工具、弱模型则更依赖领域脚手架,说明 harness 的价值高度取决于模型自身能力而非一套方案通吃。🔗 链接
- @willdepue:对无 logits 蒸馏的估算与文献证据表明,只采样教师输出带来的效率损失可能约为 2–3 倍而非数量级下降,这降低了黑盒模型蒸馏的理论门槛。🔗 链接
- @quxiaoyin:中国模型团队开放权重兼具海外获客、激烈竞争、较低商业化门槛和政策资本激励,解释了为何它们能用开放策略换取全球影响力后再通过 API 与订阅变现。🔗 链接
- @tonyzzhao:Sunday Robotics 将数据采集和评测全部内建,认为二者才是顶尖机器人研究者的最大限速环节,凸显具身智能竞争正在从模型参数转向数据闭环。🔗 链接
- @emollick:Codex 仅需一次安装授权便自主下载 Blender、建模水獭并制作动画,展示计算机操作智能体已能跨安装、学习和创作完成长链路陌生任务。🔗 链接
- @Saboo_Shubham_:从循环到动态图的变化让智能体组织结构能在执行中自我改写,意味着多智能体编排开始从固定流程迈向可动态重组的组织系统。🔗 链接
- @op7418:Claude Fable 5 确认长期进入 Max 和 Team Premium 订阅且保留 50% 限额,OpenAI 与 Kimi 的竞争已直接转化为用户可获得的模型供给。🔗 链接
- @yongfook:设计模型缺少像开源代码那样包含讨论、迭代和质量信号的大规模训练语料,因此 AI 设计能力可能不会复制编程模型的同等加速曲线。🔗 链接
💻 Tech
- @xiaopenghexpeng:小鹏在慕尼黑实测面向欧洲交通规则与路权体系适配的新一代 NGP,表明中国智能驾驶出海正从车辆销售深入到本地化软件能力。🔗 链接
- @marclou:TrustMRR 的 8,281 家创业公司中 51% 近 30 天零收入、仅 0.4% 月收入超 10 万美元,这组分布直观揭示独立创业的真实商业化漏斗远比成功故事残酷。🔗 链接
🌐 其他热点
- @paulg:年轻创始人常能判断技术能力却难识别品格,早期招聘因此容易招到“聪明但有毒”的人,说明识人能力或可信合伙人是创业团队的隐性基础设施。🔗 链接
📊 扫描 263 条 | 覆盖 21.0h | 精选 14 条
J 更早 K 更新 G 归档 / 主题