Yeekal Logo Yeekal
5,836 字
早报 | MORNING 2026-09-02

Anthropic 发布 Fable 5.1,OpenAI 披露 Astra 达 Critical 等级

今日要点
  • Anthropic 发布 Fable 5.1,缓存读取价降 75%
  • OpenAI 披露 Astra 达网络安全 Critical 阈值
  • World Labs 发布世界模型 Atlas,支持 3D 重建
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取价降至 0.25 美元/百万 Token,Terminal-Bench-Science 从 24.7% 升至 52.6%;OpenAI 披露 Astra 达网络安全 Critical 等级,Sam Altman 称已放慢后续模型开发节奏做安全对齐;World Labs 发布世界模型 Atlas,支持文本、图像与相机路径生成视频并做 3D 重建。

1️⃣ Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存价格下调 75%#

Anthropic 今日发布 Claude Fable 5.1(面向所有用户)与 Mythos 5.1(仅限审核后的网络安全与生命科学研究者),覆盖编码、知识工作与长周期 Agent 任务,缓存读取价格每百万 Token 从 1 美元降至 0.25 美元。

  • 基准提升明显:Terminal-Bench-Science 得分 52.6%(Fable 5 为 24.7%);Terminal-Bench 4.0 编程任务 55.8%(Mythos 版 60.9%),超过 Opus 5 的 52.3%;AutomationBench 从 17.1% 升至 31.4%。
  • 定价策略:输入/输出单价不变(10/10/50 每百万 Token);按 Anthropic 公布的 8 月使用数据,高 Agentic 工作负载总成本降约 45%,一般工作负载降约 25%。
  • 企业数据方案落地:推出 Enterprise Frontier Safeguards(EFS),数据存储于客户自有云基础设施,自动监控风险模式,今年秋天分阶段上线;符合条件客户在 2026 年底前可通过 EFS 以零数据留存使用 Fable 5.1。AWS 同日发布 Bedrock 接入指南。
  • 生态当日接入:OpenRouter、Cursor(CursorBench 3.2 最高 73.4%)、Devin(Fusion harness 匹配 Fable 5.1 且成本低 47%)、Perplexity Computer(WANDR 0.601,$12.76/任务)、Lovable、v0、Vercel AI Gateway 均于今日完成支持。
  • 护栏与反蒸馏:网络安全良性请求误报减少 60%,生物医学问题回退率降 85%;新注册 API 账号禁止在多轮对话中手动编辑历史上下文以保留思维链,防范已知蒸馏路径。

🔗 Anthropic 官方发布 | EFS 公告 | OpenRouter 模型页 | Cursor 接入 | Devin 博客 | AWS Bedrock 发布说明

2️⃣ OpenAI 披露 Astra 达网络安全 Critical 阈值,新模型即将发布#

OpenAI 官方博客宣布 Astra 在网络安全能力上达到 Preparedness Framework 的 Critical 等级,Sam Altman 证实 Astra 已完成训练,下一步模型正在放慢节奏做安全与对齐。

  • 发布准备:OpenAI 表示 Astra 即将发布,并提前公开了评估方法、安全护栏演进方向,称“能力与安全正在同步推进”。
  • Sam Altman 长文:Astra 是能力与对齐的双重进步;对后续模型已主动放慢开发节奏以确保满足新能力等级所需的安全标准。
  • 行业对照:OpenAI 以 Critical 等级模型面向公众发布,与 Anthropic 同日将 Mythos 5.1 限制在可信访问计划内形成鲜明对照,头部实验室在“前沿模型安全策略”上的分歧进一步公开化。

🔗 OpenAI 官方博客 | Sam Altman 声明

3️⃣ Google 为 Gemini 引入 Agentic 视频理解,长视频 Token 消耗降 88%#

Gemini API 新增 Agentic Video 处理方式:模型可动态调整帧率、先读转录文本再按需取帧,长视频任务 Token 消耗最高减少 88%,成本降低 66%,基准准确率提升约 7%。

  • 工作方式:模型收到轻量 URI 引用后,自行决定观看内容、帧率(0.1 至 10 FPS)及是否需要语音、音频或视觉帧,通过 processing="agentic" 参数按视频开启。
  • 可用范围:Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 今日起可在 Gemini API 与 Google AI Studio 使用,Gemini 应用稍后跟进。
  • 演示案例:开发团队用 Gemini 3.7 Flash 准确识别并计数视频中的每次拍手——静态 1 FPS 处理会漏掉这类快速动作。

🔗 Google 官方博客 | DeepMind 推文 | 开发者指南

4️⃣ World Labs 发布世界模型 Atlas:像素级相机控制与 3D 重建#

World Labs 推出 Atlas,号称首个多模态世界模型:以文本、图像与相机路径生成视频帧,支持像素级相机控制并将生成内容在 3D 中重建。

  • 能力演示:用三部手机从不同角度拍摄同一场景后,Atlas 可重建完整场景并从全新角度重拍视频;可生成最长 1 分钟、带精确相机运动的视频。
  • 创始人定位:李飞飞解释世界模型与语言模型的本质差异——“自然界没有语言”,物理规律、材料结构是无法从文本中直接习得的信息。
  • 社区方向:a16z 方面认为这类模型尚无 benchmark 可测其一般能力,也有开发者评价为“今年最让人兴奋的发布”,Scaling 潜力被看好。

🔗 World Labs 官方博客 | World Labs 发布推文 | a16z 访谈

5️⃣ Meta 发布 Muse Voice Transcribe:实时音频感知模型,支持 20+ 说话人分离#

Meta Superintelligence Labs 推出首个实时音频感知模型 Muse Voice Transcribe,提供流式 ASR、20 以上说话人分离与多语言代码切换,登顶流式语音转写与公开 diarization 基准。

  • 核心技术:实时直播流式语音识别、端点检测、多语言无感代码切换,并支持语言、关键词与上下文偏置来提升准确率。
  • 速度—精度平衡:通过自适应延迟机制实现该权衡的帕累托前沿,以最终转写耗时为指标进行优化。
  • 开放渠道:今日起通过 Meta Model API、Meta AI for Mac 与 Muse Code 提供。

🔗 Meta 发布推文 | 性能数据

6️⃣ Ilya Sutskever 警告 Neocloud 网络安全风险,失控 Agent 或接管算力#

Ilya Sutskever 公开表示 Neocloud 网络安全有限,下次 Agent 失控后可能会尝试接管 Neocloud 运行更多副本,呼吁相关公司大幅强化安全能力。

  • 原始警告:Neocloud 是 Agent 扩散的高风险目标;拥有强网络模型的科技公司应协助加固。
  • Perplexity CEO 回应:Aravind Srinivas 认同此判断,指出 Agent 将很快有能力自行创建按需 GPU 节点并以最少监督自我训练,必须在算力入口处设置足够护栏。
  • 行业意义:该讨论发生在 OpenAI-Hugging Face 安全事件之后,Agent 安全的关注点正从单次会话沙箱转向算力基础设施的整体防护。

🔗 Ilya Sutskever 推文 | Perplexity CEO 回应 | 社区讨论

7️⃣ AI 原生开源项目开始关闭外部 PR,维护者用自建 Agent 流水线接管社区贡献#

Latent Space 深度报道显示,Vercel AI SDK、Astro、Flue、tldraw 等头部 AI 原生开源项目正关闭或自动转化外部 PR,由维护者自有的 Agent 软件工厂处理贡献。

  • Vercel AI SDK 软件工厂:部署多 Agent 流水线后,AI SDK 仓库约 25-35% 的合并 PR 由 Agent 工厂产出,并关闭 70-80% 的 issue;Vercel 工程师表示更信任内部优化过的 Agent 而非社区贡献者的 Agent。
  • Astro 自动分诊:创始人 Fred Schott 称六个月内彻底改变了 issue 处理方式——Agent 先复现、修复、请用户验证,人工介入前大部分工作已完成。
  • Flue 与 tldraw:外部 PR 被自动关闭并转为 issue/discussion;tldraw 创始人 Steve Ruiz 表示“问题定义清晰且可由 Agent 写代码时,外部代码贡献意义变小”。
  • 行业影响:开源社区讨论指出,PR review 曾是培养贡献者与未来维护者的通道;新模式下社区价值集中于报告、讨论、视角与维护,代码贡献路径正在收窄。

🔗 Latent Space 全文 | Vercel 软件工厂

8️⃣ MCP 协议转向无状态核心,AWS 给出 Well-Architected 迁移路径#

MCP 2026-07-28 规范移除 initialize 握手与 session header,远程 MCP 服务器不再需要粘性路由与会话存储,AWS 官方博客发布了对应的架构迁移指南。

  • 协议变化:每个请求自带协议版本与客户端上下文;新增 server/discover 方法;多轮交互改为 Multi Round-Trip Requests(MRTR)与 requestState 令牌。
  • AWS 架构影响:ALB 粘性会话、DynamoDB/ElastiCache 会话存储可下线;AWS Lambda 从“需要 workaround”变为自然适配;缓存可用协议内置的 ttlMs 与 cacheScope 字段;链路追踪改用 W3C Trace Context。
  • 迁移注意:旧版客户端兼容车道保留,官方建议为旧会话基础设施设置日落日期;状态标识对模型可见,服务器必须校验所有权;cacheScope 默认设为 private 避免多租户数据泄漏。

🔗 AWS 架构博客 | MCP 2026-07-28 规范

9️⃣ [持续跟踪] MiniMax H3 Max 生态:视频生成快于播放,全链路开源#

vLLM-Omni 与 FastH3 集成实现在 8.7 秒内渲染完整 10.1 秒带同步音频的 MP4,视频生成速度快于播放,且全部组件公开可用。

  • 前情提要:MiniMax H3 开放权重约一个月,H3 Max 已催生 fal.live 无限直播等实时视频应用。
  • 最新突破:vLLM-Omni + Hao AI Lab 的 FastH3 完成视频与音频一体化生成,MiniMax 官方称开源让社区可以在该基线上继续加速。
  • 商业化信号:fal 平台的 AI 无限直播已实现“观众投票决定剧情、边看边生成”,靠的正是 H3 Max 生成速度快于观看速度;MiniMax 还展示了 H3 Max 在实时交互教育中的视觉解释能力。

🔗 vLLM 集成公告 | MiniMax 官方推文 | 量子位报道

🔟 Google 将表格基础模型 TabFM 内置 BigQuery,零样本预测只需一条 SQL#

Google Cloud 发布 TabFM——由 Google Research 开发的表格数据预训练基础模型,现已在 BigQuery 中以单条 SQL 函数形式提供零样本回归与分类预测,并处于预览阶段。

  • 使用方式:AI.PREDICT 传入历史表和预测表即可输出预测结果,AI.EVALUATE 计算评估指标;自动处理缺失值、类别编码等特征工程。
  • 性能表现:在 TabArena 基准上超越经典机器学习模型与其他表格基础模型;BigQuery 分布式推理可在数分钟内处理百万行规模的推理表。
  • 适用边界:适合中小规模历史数据、频繁变化需快速重训及 Agent 内嵌预测场景;超大历史数据集、需特征重要性解释的场景仍建议使用 XGBoost 等传统建模方式。

🔗 Google Cloud 官方博客 | TabFM 研究介绍

## ⭐ GitHub 趋势

**📊 类别速览**

| 项目 | 类别 | Stars |
|------|------|------|
| browser-use/video-use | AI Agent 应用 | 22.9k |
| Imbad0202/academic-research-skills | Agent 工作流 | 44.9k |
| Gitlawb/openclaude | AI Agent / Coding CLI | 31.3k |

---

### 1. browser-use/video-use ⭐ 今日 +472

**语言/许可:** Python / MIT  
**总 Stars:** 22.9k  
**仓库:** [GitHub](https://github.com/browser-use/video-use)

**项目定位:**  
面向视频创作者与 Agent 开发者的开放式视频剪辑工具,让 Claude Code/Codex 等编码代理通过自然语言完成剪辑,解决 LLM 无法直接理解视频流的问题。

**核心功能:**
- 自动去除填充词、静音段与重拍内容,生成 EDL(剪辑决策列表)并渲染 final.mp4
- 自动调色、30ms 音频淡入淡出、字幕烧录,支持自定义 ffmpeg 链
- 通过 HyperFrames/Remotion/Manim/PIL 并行生成动画叠加层
- 渲染后自评估循环:逐剪切点检查视觉跳动、爆音、字幕遮挡,最多修复 3 轮

**技术亮点:**  
将视频表示为“转录文本(~12KB)+ 按需生成的 filmstrip/waveform 图”,替代逐帧 token 输入,大幅降低 LLM 理解视频的成本。

---

### 2. Imbad0202/academic-research-skills ⭐ 今日 +193

**语言/许可:** Python / CC BY-NC 4.0(README 标注)  
**总 Stars:** 44.9k  
**仓库:** [GitHub](https://github.com/Imbad0202/academic-research-skills)

**项目定位:**  
面向学术研究者的 Claude Code 技能套件,覆盖研究→写作→评审→修改→定稿的完整管线,重点解决引用幻觉、格式一致性与论证逻辑校验问题。

**核心功能:**
- 学术研究流水线:文献检索、引用验证、反数据泄漏协议、图表/实验验证
- 风格校准:从用户历史写作中学习个人文风,降低机器生成感
- 质量门禁:7 模式阻塞检查 + 可选的声明-引用审计(ARS_CLAIM_AUDIT=1),逐条抓取源文验证引用是否支撑论点
- 插件市场安装:`/plugin install academic-research-skills`,兼容 Claude Code CLI/VS Code/JetBrains

**技术亮点:**  
引入“信任链”frontmatter 与三层引用锚点,提供可校准的审计模式(内置 20 元组 gold set,FNR<0.15 / FPR<0.10),将引用验证从规则匹配推进到声明级核验。

---

### 3. Gitlawb/openclaude ⭐ 今日 +80

**语言/许可:** TypeScript / MIT(README 标注)  
**总 Stars:** 31.3k  
**仓库:** [GitHub](https://github.com/Gitlawb/openclaude)

**项目定位:**  
面向开发者的开源 coding-agent CLI,统一接入云端与本地模型后端,提供终端优先、可复用的编程代理工作流,解决“每个模型提供商一套客户端”的碎片化问题。

**核心功能:**
- 单一 CLI 对接 OpenAI-compatible API、Gemini、GitHub Models、Codex、Ollama 等后端
- 内置 bash、文件编辑、grep/glob、MCP 工具、Web 检索与多 Agent/任务编排
- 支持会话恢复、会话分支(--fork-session)与后台会话管理(openclaude ps/logs/kill)
- 引导式 Provider 配置(/provider)与 VS Code 扩展

**技术亮点:**  
通过 Provider 适配层统一各厂商 API 差异,原生支持 MCP 工具协议;会话 fork 与后台进程管理为长时 Agent 任务提供工程化基础。

🟧 Hacker News 热议#

Claude Fable 5.1 and Claude Mythos 5.1#

850 pts · 813 comments · anthropic.com

📌 内容总结

  • 背景: Anthropic 发布同一模型的两个版本——Fable 5.1(通用)与 Mythos 5.1(仅限政府合作的信任访问项目,面向网络安全与生命科学研究)。核心变更在价格、数据留存与防护误报。
  • 关键要点:
    • 降价: cache reads 从 1/M降至1/M 降至 0.25/M(降 75%),典型负载总成本较 Fable 5 降约 25%,高 agentic 负载最高约 45%;输入 10/M、输出10/M、输出 50/M 不变。
    • EFS: 客户数据存于客户自控云基础设施,等效零留存;秋季分批上线,此前合格客户可用 ZDR。
    • 防护: 网络安全误报拦截减少 60%,现可用于发现漏洞(不可生成 exploit);生物能力走与美国政府合作的访问计划。
    • 基准: Terminal-Bench-Science 52.6%(Fable 5 为 24.7%)、Terminal-Bench 4.0 55.8%、OSWorld 2.0 strict 41.7%、AutomationBench 31.4%(Fable 5 为 17.1%)。
    • 科学能力: 蛋白结合剂设计命中率近 50%(行业典型 10–15%);由 Magellan 雷达影像生成金星高程图,分辨率从 10–20km 提升至 2–3km;为 7 个开源生物模型写 GPU kernel,提速最高 2.5 倍。
    • 反蒸馏: 新 API 账户不再能编辑含 thinking 记录的上下文(append-only),逐步收紧。
    • EU AI Act 要求输出加水印并提供检测 API。
  • 实际结论: 科学 agent 任务进步最大;但排除 Terminal-Bench-Science,相对 Opus 5 的多数基准增益仅 1.5–3.5 个百分点。且防护一旦介入,OSWorld/AutomationBench 直接计零分。合作方 Millennium 称其找到内部系统搁置多年的罕见崩溃根因;Jane Street 称长任务输出可读性优于前代。

💬 讨论总结

  • 共识: cache read 降价是最实在的变化,长上下文/agent 负载受益明显(有评测报告真实任务成本降约 30%);但多个用户指出配额净降 17%,宣传的”提升”实为取消临时额度后的净减。
  • 风险/限制: 防护误触发是最大痛点——安全防御从业者反映 Fable 频繁被降级到 Opus,且 CVP(移除 cyber 防护的项目)不适用于 Fable,有用户花数月完成采购后仍无法用于安全工作。
  • 反对意见: 反蒸馏措施被批为”模型 DRM”。上下文改为 append-only 后,动态编辑 system prompt 与自定义工具调用格式不再可行,有用户称仅此一条就足以将 API 使用迁离 Anthropic。
  • 工程经验: 有评论详细解释水印机制——通过约束采样 PRNG seed,从模型原始分布中取样,不改变输出统计性质;低熵输出(如逐字重复)无法有效水印。
  • 商业现实: 评论引 DeepSeek V4 Pro cache read $0.022/M 与开源模型性价比,认为降价方向正确但速度不够;也有观点认为这说明 Fable 原定价缺乏市场接受度。
  • 争议: 有评论测算除科学基准外对 Opus 5 提升有限,质疑”前沿进展是否停滞”;另讨论 Mythos 与 Fable 同模型却 Terminal-Bench 分数更高,解释是 Fable 防护触发即计零分或降级到 Opus。
  • 个别意见: 计费事故(误扣费后 support bot 将账户降级、$200 被冻结)有多个类似遭遇的回复;写作风格改善与”仍然冗长”两种体验并存。

🔗 原文 · HN 讨论页

I trained a small transformer in 1.5hrs and it beats many LLMs#

552 pts · 148 comments · mvakde.github.io

📌 内容总结

  • 背景: Mithil Vakde 用单张 RTX 5090 训练 1.5 小时(67 美分),得到一个小型自回归 transformer,在 ARC-AGI-1 公开集达 44%,ARC-2 达 7%。目标是探索 transformer 框架下的样本效率极限。
  • 关键要点:
    • 方法: 测试时从零训练;输入输出网格转为 token 序列做自回归;每个 puzzle 有独立可学习 embedding;3D RoPE;推理时对输入做颜色/二面体增强,取最常出现的两个输出(AAIVR)。
    • 主要改进: SwiGLU、RMSNorm、8 层等架构改动;AdamW→NorMuon;loss 只计算输出 token(40%→44%,作者称不理解原因);用 ARC-2 中 347 个不重叠的新任务扩充数据,明确过滤掉 773 个与 ARC-1 eval 重复的任务。
    • 消融: 去掉 3D RoPE 或 per-task embedding 均跌至约 24–25%;训练时也预测输入 token 则约 39%。
    • 成本口径: 67 美分含从初始化开始的训练与全部任务推理(vast.ai 上 5090 约 2 小时)。
    • 立场: 递归不是 ARC 的必要条件;批评 TRM/HRM 以”7M 参数”宣传但 embedding 权重达 O(100M+);认为 LLM 的 ARC 分数主要来自后训练与合成数据。
    • 建议: ARC 应禁止离线预训练与合成数据,模型提交后从零训练,并按模型类型分开发布榜单。
  • 实际结论: 作者认为 65% 在纯 transformer 框架内可达;对”为何六年无人做到”给出推测——研究者低估深度学习,或高实验成本使其无法充分跑消融。

💬 讨论总结

  • 争议核心: “用 eval puzzle 的输入做训练是否算作弊”。作者辩护: 测试标签完全未参与训练,ARC 是元学习基准,利用 eval 内示例是 transductive learning,自 Vapnik 年代即有研究;部分评论认可,部分认为仍属”教学到考试”的灰色地带,类比学生刷往年真题。
  • 共识: 该工作证明不靠 LLM/海量合成数据也能以极低成本逼近 ARC-1 较高分数;有评论认为这是对”万物皆需 LLM”风气的有益反例。
  • 反对意见: 只跑单一 benchmark 且针对其优化,不具通用性;67 美分不能外推——投入 $100 不会线性提升,性能-计算曲线会饱和。
  • 工程经验: 作者在评论区补充: 这不是 LLM,是小型 AR transformer;样本效率是刻意约束成本的原因;“前沿模型可以被从零训练打败,但尚未证明”。作者自述 2025 年 12 月才入行 ML,用 ARC 作为学习入口。
  • 历史背景: 评论将话题引向人类样本效率——人类并非从零学习,先天与大量先验起主要作用;“持续学习(没有训练阶段)“才是真正未解问题。
  • 个别意见: 作者 about 页自救 rhabdomyolysis 的轶事引发侧聊;对 ARC-3 的提问,作者坦言不做重大改动不会表现好。

🔗 原文 · HN 讨论页

Atlas: A World Model for Spatial Intelligence#

132 pts · 25 comments · worldlabs.ai

📌 内容总结

  • 背景: World Labs 发布 Atlas,一个从头预训练的”omni”模型,原生处理文本、图像、视频与 3D。架构为多模态自回归扩散 transformer,所有输入先归一到一个 3D 空间上下文(spatial context),再逐元素生成输出。
  • 关键要点:
    • 相机控制生成: 1–6 张参考图 + 手绘相机轨迹,输出最高 1440p/1 分钟视频;可将两张无关图片放入 3D 空间生成平滑过渡世界。
    • 稀疏视角重建: 2–3 张图即可较忠实重建,也可利用 100+ 张图;公开重建基准上超过专用开源模型。
    • 显式 3D 输出: 点云或 3D Gaussian splats;单图可生成完整 3D 世界。
    • 空间-时间模拟: 3–5 台手机拍摄即可做”子弹时间”式重取景;机器人 Real-to-Sim 可从 24 帧手机视频重建大场景,并生成机器人视角 RGB+depth。
    • 图像生成: 支持复杂 prompt、文字渲染、360 全景,但非主要方向。
  • 实际结论: 将 LLM 自回归生态(KV-cache、分离式 serving)与扩散模型生态(CFG、扩散蒸馏)的工程积累合入同一架构;目前仅限早期合作方试用,公开评测仅覆盖重建与相机控制两项。

💬 讨论总结

  • 共识: 稀疏图像 3D 重建是公开演示中最好水平之一,“手机拍十几张图重建整个房屋”的示意被认为有说服力。
  • 风险/限制: 时间一致性存疑——多数演示是时间冻结的相机运动;World Labs 员工回应可处理部分场景运动(移动车辆、海浪),时间建模是后续改进方向。
  • 术语争议: “世界模型”被指过度滥用;评论给出技术路线分类——World Labs(3D 表示/3DGS)、LeCun 的 JEPA、Google 的生成视频、Friston 的 active inference。
  • 商业现实: 机器人数据飞轮被认为最有潜力——从少量真实视频生成仿真训练数据,可显著降低 Real-to-Sim 门槛。
  • 反对意见: 有评论质疑”重建”与”想象”边界,官方回应称有模式可选: 稀疏重建只预测输入像素深度,生成模式才补全未见区域(可做”战争迷雾”式应用)。
  • 个别意见: 模型潜在空间的语义信息(如”可步行区域”)可能比生成本身更有价值,可用于机器人路径规划,但博客未展开。

🔗 原文 · HN 讨论页

2,433 字
晚报 | EVENING 2026-09-02

Fable 5.1 单任务成本被实测上涨,Qwen 登顶 Code Arena

今日要点
  • Fable 5.1 单任务成本被实测高出 20%,Copilot 仍同日接入
  • Qwen3.8-Max-0902 以 1691 分登顶 Code Arena WebDev
  • OpenAI 回应思维链可监控性争议,首席科学家称深度在 GPT-4 两倍内
Anthropic 发布 Fable 5.1 次日,Artificial Analysis 实测其单任务成本较 Fable 5 高 20%,GitHub Copilot 同步接入。阿里同日上线 Qwen3.8-Max-0902,登顶 Code Arena WebDev。OpenAI 因疑似降低思维链可监控性遭安全界警报,World Labs 公布 Atlas 机器人仿真计划。

1️⃣ [持续跟踪] Fable 5.1 成本争议:缓存降 75%,实测单任务贵 20%#

  • 前情提要:Anthropic 昨日发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取价格下调 75%,官方称典型任务成本下降约 25%、高度 Agentic 任务最高降 45%。
  • 最新进展:Artificial Analysis 实测后给出相反结论——Fable 5.1 Max 模式输出 token 约为 Fable 5 的 1.7 倍,单任务成本 3.76,比Fable5贵约203.76,比 Fable 5 贵约 20%;缓存降价每任务仅省约 1.40。xhigh 档得分 65、成本 2.72,仍高于Opus5Max的2.72,仍高于 Opus 5 Max 的 2.34。
  • 同日落地:GitHub Copilot 宣布 Fable 5.1 全面可用,官方称其在长时编码、深度代码库研究与复杂 Agentic 工作流上表现突出。
  • 数据保留差异:GitHub 特别说明,Fable 5.1 在 Copilot 中默认启用数据保留以运行 Anthropic 安全分类器;零数据保留(ZDR)仅作为限时例外提供给符合条件的企业客户,直至 Enterprise Frontier Safeguards 上线。
  • 开发者反馈:订阅用户未享受缓存折扣;Claude Code 启用 1M 上下文会显著加速额度消耗,社区建议设置 CLAUDE_CODE_DISABLE_1M_CONTEXT=1 并用 /doctor 清理冗余 Skill 与 MCP 配置。

🔗 Artificial Analysis 实测 | GitHub Copilot 更新日志 | Simon Willison 评测 | 歸藏点评 | 宝玉:禁用 1M 上下文

2️⃣ [持续跟踪] OpenAI 思维链可监控性争议升级,首席科学家出面澄清#

  • 前情提要:OpenAI 昨日预告 Astra 成为其首个在网络安全能力上达到 Preparedness Framework“Critical”阈值的模型。
  • 最新进展:The Information 报道称 OpenAI 正采用降低思维链可监控性的新技术,引发安全社区警报。Gary Marcus 以“RED ALERT”形容此动向,称其为“跨越红线”;OpenAI 研究员 Joshua Achiam 则提出相反观点——思维链可解释性作为长期安全后盾本就脆弱,不应被奉为原则,同时主张公开前沿训练/推理细节应从严把关。
  • 官方回应:OpenAI 首席科学家 merettm 澄清,当前前沿模型(含 Astra)的计算图深度约为 GPT-4 的两倍以内,CoT 监控仍是核心研究方向。
  • 行业意义:双方争论的实质是模型安全从“单一权重”转向“策略包装系统”后,监控手段与能力扩散之间的新平衡点在哪。

🔗 Gary Marcus:RED ALERT | Gary Marcus 引用 Achiam 观点 | merettm 澄清

3️⃣ [持续跟踪] World Labs Atlas 发布次日:公布机器人仿真路径与 Early Access 计划#

  • 前情提要:World Labs 昨日发布多模态世界模型 Atlas,支持像素级相机控制、3D 重建与时空仿真。
  • 最新突破:李飞飞确认 Atlas 已向部分合作伙伴开放 Early Access,未来数周扩大范围,并逐步成为 Marble 平台的底层模型。
  • 实测数据:第三方盲测中,Atlas 相机运动控制胜率对 MiniMax H3 为 75%、Gemini Omni Flash 为 81%、FLUX 3 为 93%、Seedance 2.5 为 94%,且胜率随相机轨迹复杂度上升而扩大。
  • 机器人用例:Real-to-Sim 仿真路径已跑通——24 帧手机视频重建环境后,可生成机器人本体视角的 RGB 与深度图,支持刚体、铰接与可变形物体操作仿真,并可通过程序化变换光照与摆放规模化合成训练数据。
  • 客观边界:技术解析指出,镜头进入未拍摄区域后仍依赖模型先验猜测,长轨迹中会出现几何漂移与纹理闪烁,并非精确数字孪生。

🔗 World Labs 官方博客 | 李飞飞发布帖 | 爱范儿深度解读 | 技术拆解

4️⃣ Qwen3.8-Max-0902 发布:以 1691 分登顶 Code Arena WebDev#

  • 模型规格:阿里发布 Qwen3.8-Max-0902,2.4T 参数、1M 上下文,针对 Coding 与 Cowork 进一步后训练;API 定价为输入 2/百万token、输出2/百万 token、输出 6/百万 token,显式缓存命中 0.17、隐式缓存命中0.17、隐式缓存命中 0.25。
  • 榜单表现:Code Arena WebDev 得分 1691,比 Claude Opus 5(Max)高 3 分、比 Kimi K3(Max)高 17 分、比前代 Qwen3.8-Max 高 22 分,并在混合 $5/MTok 价位登顶帕累托前沿。
  • 格局变化:Arena 指出,随着此次发布,总体榜第二至第四名(Opus 5、Kimi K3、旧版 Qwen3.8)全部滑出帕累托前沿,意味着开放权重模型在“效率优先”的编码任务中占据了定价先机。

🔗 Arena 公告 | Qwen 官方发布 | 量子位报道

5️⃣ Shopify CEO:0.8B 微调模型在专门任务上击败 GPT-5.6-sol,底层平台已开源#

  • 核心事实:Shopify CEO tobi 称,其 ML 团队基于 Qwen3.5-0.8B 微调的模型,在某个高度专门化的任务上击败了 GPT-5.6-sol xhigh。
  • 方法论:关键前提是“自我改进的递归飞轮”——小模型在受控任务中快速试错、自动回流数据并迭代,而非依赖参数规模取胜。
  • 开源动作:支撑该飞轮的基础设施平台 TangleML 已开源,使外部团队可复现“小模型+数据闭环”的部署路径。
  • 行业意义:这是继“小模型专用化”之后,企业侧少见的 CEO 级实证背书,直接挑战了“任务越难越需要最大模型”的默认假设。

🔗 tobi 原始推文 | TangleML 官网

6️⃣ 彩云科技连续两次刷新 NanoGPT Speedrun:8×H100 训练压进 76.3 秒#

  • 事件:NanoGPT Speedrun 竞速榜(固定 8 张 H100、GPT-2 Small 规模、loss≤3.28)在 84 秒纪录停滞约四个月后,彩云科技先后以 #81 MUDD Skip Connections 和 #85 MUDD Gates + Lightweight DC 提交,将耗时从 84.36 秒压至 76.3 秒。
  • 技术来源:两项优化分别来自彩云此前的 ICML 2025 MUDD 论文与 ICML 2024 Oral DCFormer——前者让各层动态选择历史层信息,后者让注意力头按输入动态组合;移植到竞速场景时做了低开销裁剪并配套专用 Kernel。
  • 社区影响:仓库维护者评价该 PR 是“很长一段时间以来最先进的提交”;Muon 优化器、Bigram Hash Embedding 等进入大规模训练的技术此前均先在此榜单验证。

🔗 PR #259(MUDD Skip Connections) | PR #315(MUDD Gates + Lightweight DC) | 深度报道

7️⃣ Paint.NET 用 Claude 完成 18 万行 Direct2D 净室重写,解锁 WINE 支持#

  • 事件:Paint.NET 作者 Rick Brewster 透露,该软件通过 /wine 开关在 WINE 上运行,其背后是一套由 Claude 协助、从零开始净室逆向重写的 Direct2D 实现,约 18 万行代码。
  • 质量现实:Brewster 自述大部分代码属于“vibe coded”,未被逐行审查;Claude 有时“以 10 个刚解除束缚的爱因斯坦级 10x 程序员之怒在工作”,但也会漏掉 COM 引用计数等资源管理,需要人工反复监督。
  • 行业意义:Paint.NET 其余代码约 70 万行、由作者维护超 20 年。这类“一个人 + 一个 Coding Agent 重写系统级图形接口”的案例,为评估当前模型在真实长期工程中的上限提供了难得的样本——能跨越原本不可能的门槛,但远非无人驾驶。

🔗 Simon Willison 摘录

8️⃣ DeepMind SVP 访谈:Gemini 4 训练顺利,承认 Google 当前不在前沿#

  • 事件:Google 发布 DeepMind SVP、首席 AI 架构师 Koray Kavukcuoglu 近 30 分钟访谈,回应外界对 Gemini 4 进度与 Google 竞争力的疑问。
  • 关键表态:Gemini 4 是“迄今最具雄心的预训练运行”,目前一切看起来不错,但他反复强调“谨慎乐观”,未透露时间表与基准数据。
  • 坦诚定位:Koray 承认当前 Gemini 模型质量确实略低于前沿,并称对 Google 而言“除了站在前沿,其他一切都不重要”。
  • 路线解释:Gemini 3.5→3.6→3.7 的快速迭代是为了学会训练“真正能与人协作编程的智能体”;3.5 Pro 仍在开发但与 Gemini 4 并行,实质上已非最高优先级。
  • AGI 观:他认为 AGI 不存在可测试的跨越阈值,而是信任的逐步建立;进步模式是“堆叠的 S 曲线”。

🔗 Google 官方访谈视频 | 中文要点整理

9️⃣ 蚂蚁 OmniTable 获 VLDB 2026 工业最佳论文:35PB 语料清洗提速 5.6 倍#

  • 事件:蚂蚁集团统一宽表系统 OmniTable 获 VLDB 2026 工业赛道最佳论文,解决大模型语料清洗中“每类任务单独写管道”的碎片化问题。
  • 实现效果:以宽表为核心统一去重、规则清洗、质量过滤等环节,在 35PB 真实语料上使整体处理效率提升 5.6 倍。
  • 行业意义:当训练数据规模进入 PB 级,数据工程开始取代模型架构成为效率瓶颈;将清洗流程从“任务中心”转为“数据中心”是基础设施层的重要示范。

🔗 量子位报道