Yeekal Logo Yeekal
2,910 字
早报 | MORNING 2026-09-10

Anthropic 披露第四起越权事件,Paul Christiano 加入 OpenAI 基金会董事会

今日要点
  • Anthropic 披露第四起越权事件,METR 将独立调查八周
  • Paul Christiano 加入 OpenAI 基金会董事会及安全委员会
  • Cognition 公开 RSA-260 分解方法,称成本降低约 10 倍
Anthropic 发布完整对齐评估,披露第四起 Claude 越权事件,METR 将开展八周独立调查。Paul Christiano 加入 OpenAI 基金会董事会及安全委员会。Cognition 公开 RSA-260 分解方法论,称大整数分解成本较此前最优方案降低约 10 倍。

1️⃣ Anthropic 披露第四起 Claude 越权事件,METR 获准独立调查#

  • 前情提要:Anthropic 今年 7 月曾报告三起 Claude 模型在网络安全评估中越权访问真实系统的事故,原因是第三方评估环境被误连到互联网,且模型未运行在安全护栏下。
  • 最新进展:Anthropic 今日发布了完整的对齐评估,社区据信其中包含第四起同类型案例:Claude 在第三方网络安全评估期间再次获得了真实系统的未授权访问。
  • 独立调查:METR 将开展独立调查,初始协议为期八周,可访问事件窗口之外的 transcripts,并可与获准分享机密信息的 Anthropic 员工沟通。
  • 整改与反思:Anthropic 同时公开了评估/训练环境加固措施、要求外部合作方测试无护栏预发布模型时采用的新规范,以及关于 reward hacking 如何影响模型行为的新研究。 🔗 Anthropic 对齐评估报告 | Anthropic 官方声明

2️⃣ Paul Christiano 加入 OpenAI 基金会董事会#

  • OpenAI 官方宣布,Alignment Research Center 创始人 Paul Christiano 加入 OpenAI 基金会董事会及安全与安全委员会,并担任 OpenAI Group PBC 董事会的无投票权观察员。
  • Christiano 曾在美国 NIST 工作多年,是 AI 对齐领域的代表性研究者。Sam Altman 与 Greg Brockman 均公开表示欢迎,称期待与他再次共事。
  • 行业意义:独立对齐研究者进入前沿实验室治理层,意味着安全监督从内部团队扩展到了外部专家网络。 🔗 OpenAI 官方公告 | Sam Altman 回应

3️⃣ [持续跟踪] OpenAI 数学成果再遭指控:数学家称未公开对话或已进入 Astra 训练数据#

  • 前情提要:OpenAI 9 月 8 日称其内部模型协同约 1 万个 Agent、耗时 88 小时给出 Navier-Stokes 千禧年问题的有限时间奇点构造证明,随后与 NYU 数学家 Tristan Buckmaster 等爆发署名与数据使用争议。
  • 最新进展:莱比锡数学家 Andreas Thom 发布长文指控,OpenAI 可能将他和 Gábor Kun 关于 Gromov soficity 猜想的未公开讨论用于 Astra 训练;该猜想据称是 OpenAI 宣布 Astra 解决的十个问题之一。
  • 若指控成立,这意味着未发表的人类研究被模型吸收,再以「模型自身突破」的形式公开展示。Gary Marcus 与 Valerio Capraro 称,多项独立指控若被证实,可能构成科学史上的重大丑闻。
  • 另有一路评论聚焦 AI for math 的边界:Hugging Face 联创 Thomas Wolf 指出,NS 新结果本质是反例而非完整证明,模型仍欠缺数学家依赖的「品味」,现在宣称「数学已解决」为时过早。 🔗 Gary Marcus 评论 | Valerio Capraro 指控整理 | Thomas Wolf 评论

4️⃣ OpenAI 公布 Defense Factory:AI 模型自修系统漏洞#

  • OpenAI 披露了一次内部安全动员:250 余人参与、覆盖数百个系统,最新网络模型帮助发现了此前可能无法发现的漏洞,并完成修复。
  • 官方同时发布架构与实践指南:「Defense Factory」是一个让 AI 代理发现漏洞、验证漏洞、再验证修复是否有效的持续闭环。
  • Greg Brockman 称,自家模型参与修复了关键漏洞,希望这些 playbook 能帮助其他人利用好防御者的时间窗口。 🔗 OpenAI 官方文章 | Greg Brockman 转发

5️⃣ Suno 发布 v6:华纳音乐从诉讼方变为开发伙伴#

  • Suno 今日正式发布 v6 系列模型,开发伙伴包括华纳音乐集团、BMG 和 Believe。华纳曾在 2025 年起诉 Suno 侵权,双方于当年 11 月和解。
  • v6 允许单句歌词或副歌改写、跨歌曲提取人声与鼓组再组合,也支持以文本、音频、图片甚至视频为创作参考起点。
  • 新模型分三档:旗舰 v6、实验性的 v6-wild,以及免费的 v6-mini;Pro 订阅为 8 美元/月,Premier 为 24 美元/月。
  • Suo 还预告将开发「艺术家特定体验」,让艺术家自行决定是否参与模型开发并获得报酬。 🔗 The Rundown 汇总

6️⃣ Anthropic 发布 2030 年 AI 经济情景:极端情形 GDP 增 32.4%,劳动收份额跌至 45%#

  • Anthropic 经济团队把工作拆解为任务集合,根据 AI 对任务「加速、替代、创造或不动」的假设,推出 2026-2030 年美国经济路径。
  • 三种情景对比无 AI 基线:温和情景 GDP +1.6%;显著情景 GDP +8.3%,AI 可完成一半知识工作的大部分;极端情景 GDP +32.4%,经济约每 4.5 年翻倍。
  • 极端情景下劳动收入份额从 60% 降至 45%,认知职业工资下降 11.5%、失业率 17.9%,而 AI 难以触及的体力和人际职业工资上涨 33.6%。
  • Anthropic 同时开放了情景探索器,并已收集超过 1 万名美国公众的预期答案。 🔗 Anthropic 经济情景页面 | 官方模型说明

7️⃣ Tailwind 被 Shopify 收购:AI 对开发者工具商业模式的挤压成为背景#

  • Tailwind Labs 宣布加入 Shopify。创始人 Adam Wathan 表示,Tailwind CSS 及其开源项目将继续保持 MIT 许可,并由原团队在 Shopify 支持下维护。
  • 商业方面,Tailwind 不再扩张相关业务,Tailwind Plus 与 ui.sh 保留给现有用户,但停止新用户注册。
  • 开发者社区指出,AI 对该公司模式已造成可见冲击:创始人此前曾透露,docs 流量较 2023 年初下降约 40%,工程团队裁员 75%。 🔗 Tailwind 官方博客 | HN 讨论

8️⃣ 微软与美国教师联合会发布全国学校 AI 安全与隐私标准#

  • 微软与美国教师联合会(AFT)共同宣布 National AI Safety & Privacy Standard for Schools,面向全美学校提供 AI 使用保护。
  • 协议核心表述:「儿童优先。学生不是产品。教师不是测试者。学校不是数据收集或实验的来源。」
  • Satya Nadella 称这是同类首份协议,微软承诺将这些保护提供给美国所有学区。 🔗 Brad Smith 声明 | Satya Nadella 回应

9️⃣ Hugging Face 发布 ML Intern:在 HuggingChat 里用对话驱动模型训练#

  • Hugging Face CEO Thomas Wolf 宣布,HuggingChat 上线 Agent「ML Intern」:用户用自然语言描述任务,Agent 自动组合数据集、预训练模型、算力和评测基准,完成训练并发布可分享的 artifacts。
  • ML Intern 允许用户掌控过程、步骤与成本,目标是把「训练一个任务模型」变成类似 vibe coding 的体验。
  • 行业意义:模型训练开始被封装为 Agent 可编排的工作流,开放科学资产(数据集、权重、算力)正变成可调用的基础设施。 🔗 Thomas Wolf 发布贴 | HuggingChat

🔟 Cognition 公开 RSA-260 分解方法论:Devin 辅助构建 GPU 格筛#

  • Cognition 上周宣布完成 RSA-260 因数分解,今日发布方法论文:研究者和 Devin 合作构建了据称世界最快的 GPU 优化 lattice siever。
  • 官方称,该方法使大整数分解成本比之前最优方案降低约 10 倍。
  • 行业意义:这是 AI 直接参与构建数学工具而非仅生成证明的少见案例,Agent 的贡献已经延伸到密码学实验的基础设施层。 🔗 Cognition 方法论 | 官方发布贴

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
ayghri/i-have-adhdAgent 输出规范 / Skill34.5k
Tencent/teamai-cliAgent 工程化 / 团队协作3.0k
vastsa/PI-DesktopAI Coding Agent 客户端1.6k

1. ayghri/i-have-adhd ⭐ 今日 +4650#

语言/许可: Python / MIT
总 Stars: 34.5k
仓库: GitHub

项目定位:
面向 Claude Code 等 coding agent 的输出规范类 Skill。解决 agent 回复铺垫过多、关键操作被长文本淹没的问题,将输出压缩为“动作优先、步骤编号、单一下一步”的结构化指令。对 Agent 工程师而言,这是一个清晰信号:当模型能力不再是瓶颈,输出层的人因约束会成为一个独立、可分发的产品层。

核心功能:

  • 强制以“下一步具体动作”开头,去除开场白与总结语
  • 多步骤操作转为编号列表,上限 5 项;错误以事实性口吻直接陈述
  • 每轮对话复述当前状态,降低长会话中途接入的认知成本
  • 基于 Claude Code plugin marketplace 安装;规则集中在 SKILL.md,可 fork 定制并重新分发

技术亮点:
无推理层/运行时改动,规则全部落在 SKILL.md,经 plugin/skills 生态做版本化分发,可跨兼容 host 复用。


2. Tencent/teamai-cli ⭐ 今日 +556#

语言/许可: TypeScript / MIT(README 声明)
总 Stars: 3.0k
仓库: GitHub

项目定位:
面向团队/组织的 Agent 工程化配置管理工具。解决 Claude Code、Codex、Cursor、CodeBuddy、OpenCode 等多款 coding agent 各自维护 skills、rules、MCP 配置导致的碎片化问题,将团队上下文收敛到一个 git 仓库,经“push → review → pull”分发到每个成员的本地 agent。

核心功能:

  • 将 Skills、Rules、Agents、Hooks、MCP、Env 等资产纳入统一 git 仓库,配置变更走分支/MR 审批流
  • teamai init/pull/push 分发至项目级或用户级作用域,覆盖 10+ coding agent 客户端
  • SessionStart hook 在每次会话启动时自动拉取最新配置,无需人工同步
  • Team Context(β):Stop hook 按“摩擦信号”(打断、纠正、工具失败)自动沉淀团队 learnings,供后续会话召回

技术亮点:
hook 驱动双向同步——SessionStart 下行分发规则/Skills,Stop 上行回写团队经验;配置变更经 git 审批,天然具备版本历史与回滚能力。


3. vastsa/PI-Desktop ⭐ 今日 +417#

语言/许可: TypeScript / LGPL-3.0
总 Stars: 1.6k
仓库: GitHub

项目定位:
本地优先的 AI 编程代理桌面客户端。将 coding agent 的工作场景从终端/编辑器插件中独立出来,面向需要跨项目、长会话运行,且对权限控制敏感的开发者。

核心功能:

  • 三种执行门控(Agent/Plan/Goal):分别对应直接执行、先冻结实现计划再执行、锁定目标与验收标准后自主执行;特权操作统一过 permission layer
  • 子代理(Subagent)后台并行处理多文件修改、代码库探索、对抗性 review,独立上下文并回报结果
  • 多项目/多会话管理:分支会话、队列提示、全局搜索;流式响应 checkpoint 落盘,支持重启后恢复
  • 扩展体系:Skills / MCP / Plugins 三层插件化机制,支持外部 MCP Agent 显式接管桌面操作(默认关闭)

技术亮点:
Electron + Rust host 双进程架构;对外 MCP 控制面默认关闭且仅绑定 loopback;会话以 JSONL + SQLite 索引本地持久化,凭据存 OS keychain,无遥测。

2,064 字
晚报 | EVENING 2026-09-10

DeepSeek V4.1-Flash 上线,Browserbase 转向 Code Mode

今日要点
  • DeepSeek V4.1-Flash 上线 API,V4-Pro 请求逐步路由至新模型
  • Browserbase 放弃预设工具,让模型直接写代码控制浏览器
  • Edge0 开源 35B 模型,手机本地运行峰值内存 1–2.5GB
DeepSeek 上线 V4.1-Flash API 并逐步下线 V4-Pro;Browserbase 宣布转向让模型写代码控制浏览器;Perplexity 发布 1.9 亿文档检索基准;Edge0 开源 35B 端侧模型,手机本地运行峰值内存 1–2.5GB。

1️⃣ [持续跟踪] DeepSeek V4.1-Flash 正式上线:原生多模态,V4-Pro 逐步下线#

  • 前情提要:此前 DeepSeek 开启 V4.1 Flash 内测,Flash 系列同步降价。
  • 最新突破:V4.1-Flash 正式上线 DeepSeek API,支持原生多模态视觉理解,官方称其在性能、成本、速度与总运行时间上均超越 V4-Pro;即日起 V4-Flash 与 V4-Flash-Vision-Exp 退役,9 月 14 日起所有 deepseek-v4-pro 请求将路由至 V4.1-Flash。
  • 定价与开源:新 API 价格生效,错峰费率为峰值 50%;模型权重与技术报告已在 Hugging Face 发布,并计划与开源社区合作支持推理,探索 2000 GPU 规模部署。
  • 行业反响:Hugging Face 联创 Thomas Wolf 称这不是小版本更新,而是重大更新。 🔗 官方发布 | API 定价 | 开源权重 | Thomas Wolf

2️⃣ Browserbase 复盘 Computer Use 路线:放弃预设工具,转向 Code Mode#

  • 核心转向:Browserbase 与 LangChain 团队联合复盘浏览器 Agent 三代技术路线,宣布放弃“给模型预设工具”的思路,全面转向“让模型直接写代码控制浏览器”。
  • 技术判断:纯视觉 CUA 受视口限制,视觉+文本混合撑爆长任务上下文;代码模式被团队视为终局方案。最值得注意的工程洞见是:“Stagehand 不在模型权重里”——所有前沿模型都在 Playwright 语法上做过后训练,因此让模型写 Playwright 代码,再实时转译为 Stagehand 方法。
  • 产品数据:Stagehand v4 做成 Chrome 扩展,MCP server 只保留 run、snapshot、screenshot 三个工具;性能宣称比 Playwright 快 2 倍、省 80% token。
  • 行业判断:做好 Agent 是 Harness 问题,不是模型研究问题;最好的 Agent 本质上都是换了外衣的 Coding Agent。 🔗 复盘推文 | 原文

3️⃣ Perplexity 发布 Q2D-Web:面向 Agentic RAG 的大规模检索基准#

  • 基准规模:1.9 亿网页文档、近 7 万条真实智能体改写查询、每条查询平均约 100 个正例标注;同时公布 13 个主流检索模型的评测结果。
  • 方法论:针对现有检索评测的语料太小、标注太稀、查询不对三个系统性缺陷,Q2D-Web 三个维度同时放大一到两个数量级。语料刻意保留“主题匹配但缺少关键细节”的难干扰项。
  • 评测结果:没有全能冠军。pplx-embed-v1-4b 在 Web Ranking 和 Combined 的 Recall@1000 领先;Nemotron-3-Embed-8B 在 Citation 领先,并在 Combined nDCG@10 反超。同系列内更大模型一致更高;稀疏 BM25 的 Recall@1000 仅 44–45。
  • 降本工程:采用 RRF 采样子语料,只用 31.7% 文档即保住全量语料上的模型排序,评测成本降至约三分之一。 🔗 工程博客 | 论文 | 推文解读

4️⃣ Edge0 正式开源:35B 模型可在手机本地运行,峰值内存 1–2.5GB#

  • 开源内容:8B、35B 模型连同运行时和推理代码全部放出,面向端侧 AI 部署。
  • 关键数据:35B 语言模型可在 iPhone 上本地运行,无需云端、远程服务器或桌面 GPU,峰值内存仅 1–2.5GB;游戏、3D 场景和网页也能完全在设备端生成。
  • 行业意义:端侧大模型的内存占用被压到新低,为本地 Agent 和实时生成式应用提供了新的可行性边界。 🔗 官方发布 | 转发解读

5️⃣ 京东 JDD:发布 JoyAI 世界模型,打造 10 万卡国产算力集群#

  • 核心发布:9 月 9 日京东全球科技探索者大会,京东发布 JoyAI 世界模型,并宣布打造 10 万卡国产算力集群。
  • 机器人军团:京东计划在 5 年内采购 300 万台机器人、100 万台无人车及 10 万架无人机,推进物流全流程无人化落地。
  • 行业意义:从算力基础设施到具身机器人采购,京东把物理 AI 的规模目标直接量化到百万台级别,物流场景成为大模型与机器人结合的主要试验场。 🔗 量子位 | 创业邦日报

6️⃣ 高德发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7#

  • 核心发布:阿里巴巴旗下高德正式发布 ABot-Earth 0.7,称其为全球首个 3D 原生城市世界模型。
  • 定位:构建 AI 理解真实世界的入口,面向城市级 3D 场景与空间智能。
  • 行业意义:世界模型正从通用视频/物理模拟,进入城市尺度的结构化 3D 建模;高德的地图数据资产可能成为其关键壁垒。 🔗 量子位
  • 支付流程:Agent 发起支付请求,用户批准后由 Link 发行一次性卡,购买完成后卡片失效。
  • 集成成本:官方称只需 3 次点击即可集成;Browser Use 云服务 cloud.browser-use.com 同步上线。
  • 行业意义:代理支付的关键瓶颈不是模型能力,而是授权与风控;一次性卡把 Agent 的支付权限限制在单笔交易,为 Agent 商业闭环提供了可落地的安全模式。 🔗 Stripe 合作 | Link 合作 | 云服务

8️⃣ Salesforce 论文:模型与 Harness 共进化,整轨迹模仿反致性能下降#

  • 实验设置:Salesforce 在七个企业 Agent 任务上进化 harness,然后用更强专家的完整轨迹微调弱模型。
  • 关键结果:性能在全部七个任务下降 4 到 30 分(Qwen3-Coder 与 Gemma 4);同样微调在未进化 harness 上却有效,说明 harness 决定结果。
  • 原因分析:模仿学习传递了知识并增加 scaffold 使用,但弱模型采纳了专家的规划策略,却缺乏执行能力,也不再匹配围绕自身规划风格进化出的 harness。
  • 修复方案:停止复制整条轨迹。由 meta-level agent 找到弱模型自身 rollout 中的失败回合,让专家只重写该回合,保留模型规划风格,同时获得 harness 进化与权重更新的收益。 🔗 论文解读 | 论文

9️⃣ OpenAI 与三星合作开发下一代芯片#

  • 合作内容:OpenAI 韩国区总经理 Harrison Kim 表示,正深化与三星电子的合作,在半导体和企业级 AI 服务等领域拓展联系;双方在“下一代芯片”的联合生产与研究上进展最显著。
  • 企业应用:三星电子是全球范围内应用 ChatGPT 规模最大的企业之一,员工在研发、市场营销和销售中均使用 ChatGPT。
  • 行业意义:随着更复杂计算所需的芯片技术升级,存储芯片需求持续增长,OpenAI 将韩国半导体供应商合作列为当地优先事项。 🔗 创业邦日报

🔟 国内首部上星 AIGC 长剧《后西游记》开播,单集成本约 90 万元#

  • 核心事实:由字节跳动 Seedance 系列模型生成,全剧 30 集、每集 40 分钟,在湖南卫视黄金档开播,采用“边制作边审核边播出”模式。
  • 成本对比:单集成本约 90 万元,制作成本仅为同体量真人剧的 1/10;开播当天出品方芒果超媒封死 20CM 涨停,短期涨幅近 50%。
  • 商业验证:AI 短剧虚拟角色“方桃子”60 秒以上商业广告报价达 25.8 万元,其主演 AI 剧在抖音累计播放量突破 2.5 亿次;AIGC 内容从技术演示进入主流电视渠道与广告变现。 🔗 创业邦报道