1,724 字
晚报 | EVENING 2026-09-07
黄仁勋称 AGI 已实现,OpenAI 官宣自动研究实习生达成
今日要点
- 黄仁勋宣布 AGI 已到,OpenAI 研究员日均 Agent 支出达 600 美元
- 微软 Copilot 发布 Opal Autopilot,任务时长进入小时级
- Anthropic 与 OpenAI 合办数学黑客松,提供 200 万美元算力
黄仁勋公开称 GPT-6 Astra 已实现 AGI;OpenAI 发布内部研发加速报告,确认自动研究实习生目标达成,首席科学家同日发文呼吁主动减速;微软演示 Opal Autopilot,Anthropic 与 OpenAI 宣布合办数学黑客松。
1️⃣ [持续跟踪] 黄仁勋称“AGI 已实现”,Epoch 新纪录与实测分歧同场出现#
- 前情提要:GPT-6 Astra 发布后已在 Code Arena、Browser Use、DeepsecBench 等榜单陆续上分;Epoch AI 给出 ECI 169,属于“破纪录但仍在推理时代趋势区间内”。
- 最新进展:NVIDIA CEO 黄仁勋公开称 GPT-6 Astra 在约 10 万颗 Grace Blackwell NVLink72 上训练,宣布“AGI has arrived”,并预告下一批 40 万颗 GPU 上线。
- 定义与效果之争:Gary Marcus 批评“没有证据也没有定义”;Chollet 重申 ARC-3 高分不是 AGI 终点;早期开发者实测认为 Astra 的优势集中在规划、审计与 Computer Use,代码执行和回归控制仍是短板,与 Fable 5.1 相比并非全面跳跃。
🔗 黄仁勋推文 | Epoch AI 数据 | Gary Marcus 回应 | Chollet 回应 | 开发者对测记录
2️⃣ OpenAI 官宣达成“自动研究实习生”,首席科学家同日发文要求主动减速#
- 核心事实:OpenAI 在官方报告中确认,已按计划达成去年 Sam Altman 提出的目标:一个能在人类研究人员指导与目标设定下,端到端完成“原本需熟练研究员数天处理”任务的自动化 AI 研究实习生。
- 内部数据:Coding Agent 已成为研究日常;到 8 月中旬,每个研究人员工作日对应约 3.1 个 Agent 工作日,研究员人均每日 AI 支出中位数达 600 美元,P90 约 7000 美元。报告承认,研究方向与关键决策仍由人类控制。
- 减速主张:同一日,首席科学家 Jakub Pachocki 在《An Alien Mind》中表示,没有实验室已把对齐与监控解决到可长期全速扩展的程度;在建立共同安全门槛前,主动减速应成为常态,并提出第三方审计与政府、国际协调。
- 后续目标:OpenAI 计划在 2028 年 3 月前构建能自主提出假设、设计实验并迭代闭环的“自动化 AI 独立研究员”。
🔗 OpenAI 研究加速报告 | Simon Willison 解读 | 《An Alien Mind》 | Greg Brockman 推荐语
3️⃣ 微软发布 Opal Autopilot:Copilot 从问答/委派走向数小时级任务#
- 核心演示:微软 CEO Satya Nadella 展示了一个 Opal-powered Autopilot 在 Windows 365 Cloud PC 上运行,自动处理一个月野生动植物相机素材,识别动物、生成高光视频、逐条标注物种与时间、汇总表格,并制作 PPT 分享到 Teams。
- 开放状态:Project Opal 已进入 Frontier 环,后续将加入 Copilot。
- 行业含义:微软将 Copilot 的下一个阶段定义为“不只协助工作,而是拥有并完成跨越数小时甚至数天的完整任务”。
🔗 Satya Nadella 演示 | Project Opal 技术公告
4️⃣ Spotify 工程团队:把 Claude Code 的“体力活”路由给小模型,token 消耗降 90%#
- 现象:Spotify 团队发现 Claude Code 大量 token 消耗在几乎不需要推理的任务上——为回答一个方法问题读五个文件、参照 20 个测试文件生成新测试、会后更新文档。
- 方案:基于 Portal 构建两个声明式 Agent Mode,用 Gemini 2.5 Flash 作为廉价工作模型;再通过 shunt 插件拦截超过行数阈值的大文件读取和样板代码生成,让前沿模型专注推理。
- 结果:在 Java monorepo 的四个场景中,bulk-read 路径平均节省约 90% token。团队同时明确边界:不能委托编辑、不能委托推理,调试与安全关键代码仍由 Claude 直接处理。
5️⃣ SkillZip Pro 论文:Agent Skills 压缩的真正风险是丢路由,不是丢内容#
- 研究对象:阿里与浙大团队发现,生产环境中的 Agent Skills 是带渐进加载边界的目录结构,而非单个 prompt;拍平拼接会摧毁引用关系,使分支“看似存在实则不可达”。
- 方法:SkillZip Pro 采用激活感知的跨文件压缩与跨文件路由保持,并引入证人层级,无法附加证人的删除一律拒绝。
- 关键数字:在生产审核 Skills 上实现部署成本 −38.1%、单次运行成本 −10.4%,准确率 89%(基线 91–92%);无保护的激进压缩可节省 71%,但准确率暴跌 18–26 个百分点。
- 额外洞察:真实进化库中每轮新增内容约 55% 是重复文本,越早压缩收益越大。
🔗 论文 PDF | meng shao 解读
6️⃣ Google 开源 Mantis:用 Agent 自动化漏洞发现、验证与修复#
- 核心发布:Google 开源 Mantis,一个面向软件漏洞全生命周期的 AI Agent 框架,覆盖漏洞识别、验证、复现与修复。
- 背景:Google 称开发 Mantis 是为了解决传统 AI 代码扫描带来的高误报率和“幻觉漏洞”问题。
- 行业位置:这是大厂将 Agent 从代码生成推向安全运营闭环的又一案例,与 Figma 用 Agent 处理安全告警、1Password 审计 AI 补丁形成同一条技术趋势。
🔗 InfoQ 报道
7️⃣ OpenAI 与 Anthropic 联手举办全球首个数学黑客松:40 小时、200 万美元算力#
- 活动细节:参赛者将在 40 小时内,使用价值 200 万美元的算力解决、理解并展示一个数学开放问题,申请已开放。
- 参与方:活动由 Sathvik Redrouthu 团队与 OpenAI、Anthropic 联合发起,a16z、Y Combinator、Emergence Capital、Baseten 等机构提供支持。
- 看点:这是两家头部模型厂商罕见在同一赛事中提供算力与模型基础设施,数学成为 Agent 能力验证的新竞技场。
🔗 活动申请页 | AI Will 汇总 | 支持机构名单
8️⃣ 《西雅图时报》与《新闻日报》起诉 OpenAI 与微软#
- 指控内容:两家报纸指控 OpenAI 与微软在训练和运行 ChatGPT、Copilot 时未经许可复制其新闻作品,构成版权侵权。
- 诉讼请求:请求法院下令销毁侵权作品副本,以及包含这些作品的训练数据或 AI 模型。
- 关键背景:两家报纸 2024 年曾入选 OpenAI、微软与 Lenfest Institute 发起的本地新闻 AI 合作项目,但项目未包含内容授权或实时数据交换条款。