Gemini 3.8 Flash 发布,Meta 推 Muse Spark 1.3
- Gemini 3.8 Flash 发布,API 维持 $0.75/$3.75
- Meta 推 Muse Spark 1.3,contributor 定价 $0.10/$0.20
- 美司法部称版权内容训练 LLM 不构成侵权
Google 发布 Gemini 3.8 Flash 与网络安全版 Flash Cyber,API 价格维持 $0.75/$3.75;Meta 发布 Muse Spark 1.3,contributor 档 $0.10/$0.20,向 Meta 开放训练数据换低价;美司法部就 OpenAI 版权案表示,以版权作品训练 LLM 不构成侵权。
1.Gemini 3.8 Flash 与 3.8 Flash Cyber 发布,6 周内第三个 Flash 版本#
Google DeepMind 今日发布 Gemini 3.8 Flash 与网络安全专用模型 3.8 Flash Cyber,模型能力对标旗舰档位,但 API 价格继续维持在 3.7 Flash 的水平。
- 发布节奏:这是 Google 6 周内发布的第三款 Flash 模型;官方称 3.8 Flash 面向长时程软件工程、自主 Agent 与多步推理,用“更小步骤 + 更频繁验证”提升任务质量,同时保留可调思考档位控制成本。
- 渠道与价格:输入/输出仍为 3.75 每百万 token;已在 Gemini API、AI Studio、Antigravity、Gemini App、OpenRouter、Poe 和 Cursor 同步上线,并成为 Antigravity 默认模型。
- 关键跑分:DeepSWE v1.1 达到 73.7%;LMArena 评测中,Gemini 3.8 Flash (High) 在 Agent Arena 从 3.7 Flash 的 #32 升至 #14(净提升 +5.94%),Text Arena 排名 #7(1494 分);单任务中位成本 $0.22,与 Grok 4.5、GLM 5.2 同档但价格低 44-50%。
- Cyber 版与 Fairwind:3.8 Flash Cyber 在 CyberGym 上获 86.2%、CWE-Bench 47.2%;在真实 Chrome 漏洞上产出的正确补丁数量是更大商用模型的 2.6 倍。Google 通过新 Fairwind 计划向国家网安部门、电信与能源等关键基础设施开放该模型。
- 社区实测提醒:Browser Use 对比同一 Agent 任务,3.8 Flash 的 token 消耗约为 3.7 的 2.17 倍、模型调用 1.83 倍,实际支出增幅可能高于纸面单价。
🔗 Google Blog | Google DeepMind | Logan Kilpatrick | LMArena | Browser Use
2.[持续跟踪] Fable 5.1 登顶 Code Arena WebDev,领先 77 分#
Anthropic 昨日发布的 Fable 5.1 今日在 LMArena 的 Code Arena WebDev 以 1765 分登顶,比第二名高出 77 分。
- 前情提要:Fable 5.1 与 Mythos 5.1 于昨日发布,面向复杂推理与长时 Agent 任务,缓存读取价格较 Fable 5 降低 75%。
- 最新突破:Fable 5.1 (Max) 在 WebDev 榜从 Fable 5 (Max) 的 1628 分提升至 1765 分;Qwen3.8-Max-0902 与 Opus 5 (Max) 分别以 1688 和 1678 分位居其后。
- 成本位置:按约 $40/MToken 的混合价格计算,Fable 5.1 将高质量 WebDev 生成的成本-性能边界明显上移,与同价位模型拉开差距。
3.[持续跟踪] Claude 系统提示更新:明确拒绝歌词与版权角色复现#
Anthropic 公开的 Fable 5.1 系统提示新增了大段版权限制条款,禁止复制歌词、诗句、书籍段落,以及用代码绘制的版权角色和设计。
- 前情提要:索尼音乐与华纳音乐出版公司在 Fable 5.1 发布前夕起诉 Anthropic,指控其训练数据大量包含歌词。
- 最新变化:与 Fable 5 相比,新提示明确“不复制任何歌曲歌词、诗歌或书籍段落,包括最后一句、副歌、逐音符旋律;一旦拒绝,后续对改写或换种方式提出的同类请求也继续拒绝”。同时禁用 SVG、Canvas、CSS、ASCII art 等形式绘制 Sonic、米老鼠等知名角色——改变姿势、颜色或场景不构成原创。
- 附带调整:系统提示新增向 dancesafe.org 等外部减害资源导流的规则,并删除了旧版“被粗暴对待后可主动结束对话”的指引,改为要求 Claude 不卑不亢但保持帮助。
- 可追踪性:Anthropic 文档支持以 .md 形式获取系统提示,开发者可直接 diff 新旧版本;Simon Willison 建立了
claude-system-prompts仓库,用 GPT-5.6 Luna 自动生成变更摘要。
🔗 Simon Willison | Anthropic 系统提示 | simonw/claude-system-prompts
4.美司法部在 OpenAI 版权案中表态:LLM 训练不构成侵权#
美国司法部认为以版权作品训练 LLM 不违反版权法,并警告若按侵权处理会损害美国科学、繁荣与国家安全。
- 诉讼背景:该意见提交于 OpenAI 与《纽约时报》的版权纠纷中;《纽约时报》指控 OpenAI 未经授权使用其文章训练模型。
- 立场要点:DoJ 将模型训练与内容输出分开看待,支持“合理使用”路线;这是美国联邦政府部门罕见地直接为模型厂商背书。
- 潜在影响:虽然该意见对法院无强制约束力,但在国会尚无统一立法的阶段,可能影响其他未决的训练数据诉讼,并缓解企业侧对 API 服务的版权担忧。
5.[持续跟踪] Anthropic 获美国商务部信任背书,出口限制解除#
美国商务部长 Howard Lutnick 公开表示“我们信任 Anthropic”,此前针对 Fable/Mythos 的出口管制被撤销。
- 前情提要:夏季期间,美国商务部曾对 Anthropic 的 Fable 与 Mythos 模型施加出口管制,五角大楼一度将该公司标记为“供应链风险”——该措辞通常留给外国对手。
- 最新进展:Lutnick 向 Axios 表示 Anthropic“做了我们要求的事”,并称其“回到了正确一边”。
- 行业意义:Anthropic 与美国政府的关系重新校准,标志着前沿模型安全评估与政府采购之间的互动进入新的阶段。
6.DeepSeek 发布 V4 Pro 0813 与开源评估 Harness#
DeepSeek 在更新 V4 Pro 0813 的同时开源了 DeepSeek Harness,使模型表现首次可以被开发者完整复现。
- 版本更新:DeepSeek V4 Pro 0813 已上线;更大的看点是随附的评估框架完全公开。
- 开源细节:Harness 记录每一次工具调用、系统提示与子代理调度,开发者可以重放任务、检查失败原因,也可以直接 fork 改造为自己的 harness。
- 行业意义:当“哪个模型更强”的讨论越来越依赖封闭榜单时,可复现的评估层提供了独立验证路径,让模型跑分从宣传数字变成可审计的过程。
7.Perplexity 开源本地推理引擎 Lily#
Perplexity 将面向 Apple Silicon 的本地推理引擎 Lily 开源,官方测试显示吞吐较 MLX-LM 高 23%-35%。
- 技术定位:Lily 为 Perplexity Mac 应用的“混合计算”功能开发,专用于本地运行 Qwen3.6-35B-A3B,避免设备端推理拖慢 Computer 类 Agent 任务。
- 实现特点:Lily 把苹果芯片视为独立推理平台,将 Qwen 算子直接映射到其计算与内存架构,而不是通过通用运行时做间接适配。
- 基准测试:在 M5 Max MacBook Pro 上,平均 prefill 吞吐为 MLX-LM 的 1.23 倍,decode 吞吐为 1.35 倍,输出质量基本持平。
- 代码地址:项目位于 pplx-garden 仓库的
lily目录。
🔗 Perplexity | 技术博客 | GitHub
8.Cursor 支持在自有基础设施上运行 Cloud Agents#
Cursor 将 Cloud Agents 的执行层开放到用户自己的机器与第三方沙箱,Agent 循环仍由 Cursor 托管,但代码与数据无需离开企业环境。
- 新能力:用户可将 Agent 指向自建机器池并自动扩缩容,也可选择 AWS Lambda、Coder、Cloudflare、Daytona、E2B、Modal、Namespace、Vercel 等沙箱提供商。
- 典型用途:让 Agent 安全访问内网服务或专用硬件(如 GPU),同时保留 Cursor 的 IDE 编排体验。
- 行业信号:这是编码 Agent 从“厂商侧黑盒执行”转向“用户侧可信边界执行”的又一进展,与 Docker 提出的“harness 之下”runtime 治理讨论形成呼应。
🔗 Cursor | Cursor Blog
9.[持续跟踪] World Labs Atlas:从几张照片到机器人训练仿真#
World Labs 联合创始人 Justin Johnson 演示了用 5 张手机照片 + Atlas 重建房间仿真,随后让机器人基础模型在仿真中学会从未见过的空间内执行任务。
- 前情提要:Atlas 世界模型昨日发布,可从 3-5 个稀疏视角补全三维场景并生成新机位画面。
- 最新进展:a16z 访谈透露 Atlas 正在接入 real-to-sim-to-real 技术栈:上传数张照片 → 生成空间仿真 → 用自然语言让 Agent 搭建任务场景 → 对通用机器人模型做 RL 微调。
- 潜在影响:如果流程规模化,机器人跨场景部署将不再依赖昂贵的大规模真实数据采集;用手机拍几张照片即可为一个“陌生房间”定制可工作的机器人。
🔗 a16z | World Labs | 演示转发
10.纽约市公立学校全学年禁用生成式 AI(K-8)#
纽约市公立学校在 2026-27 学年禁止 pre-K 至八年级使用生成式 AI,覆盖超过 60 万名学生。
- 政策范围:禁令覆盖整个学年,涉及课堂作业与官方应用;目前未说明高中是否适用。
- 官方表态:市长 Zohran Mamdani 称不认同“AI 早期教育不可避免且必要”的行业叙事。
- 后续关注:纽约市为全美最大学区之一,其立场可能影响教育科技公司的产品策略,并加剧各州对课堂 AI 的监管分歧。
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| pacifio/atlas | AI Agent / 开发工具 | 2.9k |
| debpalash/VoiceStudio | 语音 AI / 开源产品 | 14.7k |
| google-research/timesfm | 时序基础模型 | 29.7k |
1. pacifio/atlas ⭐ 今日 +888#
语言/许可: Rust / MIT
总 Stars: 2.9k
仓库: GitHub
项目定位:
面向多编码 Agent 工作流的源码控制层,解决“代码提交与 Agent 推理过程脱节、无法追溯”的问题。适合同时使用 Claude Code、Codex 等编码 Agent 的团队和个人。
核心功能:
- 每次 Agent 会话生成 checkpoint,将 commit 与会话内的 prompts、工具调用、文件 patch 关联,支持回溯查询
- 通过 ACP(Agent Client Protocol)并行接入 Claude Code、Codex、OpenCode 等,支持在同一代码库切换 Agent 而不丢失上下文
- 本地设备端语义索引,跨 Agent 共享决策与变更记忆;
@可解析文件、符号、commit、历史会话 - 本地优先存储,git 提交通过观察而非拦截,rebase/amend 后 checkpoint 仍可关联
技术亮点: Rust 实现;本地嵌入 + HNSW 检索实现跨 Agent 记忆召回,无需外部服务。
2. debpalash/VoiceStudio ⭐ 今日 +832#
语言/许可: Python / AGPL-3.0
总 Stars: 14.7k
仓库: GitHub
项目定位:
面向自托管与隐私优先用户的本地语音处理套件,覆盖克隆、合成、配音与转录全流程,定位为 ElevenLabs 等托管服务的本地替代方案。
核心功能:
- 零样本语音克隆与基于属性描述的语音设计,支持从短视频样本生成声音
- 视频配音流水线:转写、翻译、说话人分离、配音合成与视频导出
- 内置 16 种 TTS 引擎与 11 种 ASR 引擎,支持 646 种语言目录,可通过模型目录统一管理
- 提供本地 REST/SSE/WebSocket API、OpenAI-compatible 音频 API 与 MCP Server,便于外部工具集成
技术亮点: CUDA / ROCm / MPS / MLX 多硬件后端,支持本地与远程 GPU worker 混合调度;核心流程默认离线运行。
3. google-research/timesfm ⭐ 今日 +343#
语言/许可: Python / Apache-2.0(TimesFM 3.0 预训练权重为非商业许可)
总 Stars: 29.7k
仓库: GitHub
项目定位:
面向时序预测任务的预训练基础模型,解决零样本预测和多变量/协变量建模问题,适用于业务指标、传感器、金融等时序场景。
核心功能:
- TimesFM 3.0 原生支持多变量联合预测,以及 past-only / past-and-future 动态协变量,无需任务级微调
- 支持变长上下文输入与分位数预测输出,可输出点预测 + 0.1–0.9 分位数区间
- 提供 Hugging Face Transformers + LoRA 微调示例与评估工具
- 官方在 fev-bench、TIME Benchmark、GIFT-Eval 三个时序基准中取得领先排名
技术亮点: Decoder-only Transformer 架构,在零样本通用预测任务上验证了基础模型范式;旧版本代码已迁移至独立子目录,最新 PyPI 包支持 PyTorch 与 Flax 推理路径。
🟧 Hacker News 热议#
Muse Spark 1.3#
332 pts · 234 comments · meta.com
📌 内容总结
- Meta 发布面向 agentic workflow 的 Muse Spark 1.3,定位长周期 coding agent;强调首次尝试准确率、可靠 tool calling,原生支持图像/视频/文档等多模态输入,上下文窗口 1M。
- 双档定价是核心产品决策:
muse-spark-1.3-contributor允许 Meta 用数据改进产品,0.20 per Mtok;muse-spark-1.3不参与训练,定价 4.25 per Mtok。 - 官方称视觉推理跑在真实执行环境而非脚本步骤中;benchmark 覆盖 DeepSWE 等长周期软件工程任务,并宣称接近或超过更大规模前沿模型。
💬 讨论总结
- 快速实测集中在 Simon Willison 的 pelican SVG 用例:1.3 比 1.2 更遵守指令、画面结构更好,约 4.2 美分 / 38 秒;reasoning 档位从低到 xhigh 会显著增加 token 与耗时。
- contributor 定价是最大话题。支持者认为“允许训练换折扣”是透明的价格歧视,也给出用户训练数据价值的量化锚点;不信任者则讽刺“not used to improve”只是企业版 SSO,Meta 不太可能守住边界。
- 对实际能力评价分裂:有人觉得 1.2 在 OpenCode 上免费且好用,像“工具型助手”而非多嘴的 AI;也有人遇到复杂 bug 时 1.2 会不断输出雷同 thought 总结,切到 GLM-5.3-Flash 后才解决。
- 最强质疑来自官方自己的发布口径:博客称 max reasoning 还需额外安全测试、稍后上线,但 benchmark 表只展示 max reasoning 结果。
- 评论还指出 1.3 的 pelican 用例 token 消耗约为 1.2 的 3 倍,低价是否真的便宜需要看任务总成本。
- Meta 信任问题是主要反对力量:有人因 $18B 诉讼拒绝使用;有人愿意多花钱避免 Meta 采集代码;也有评论认为 HN 对 Meta 的敌意已经盖过模型技术讨论。
- 工程经验:Muse Spark 针对自家 Muse Code harness 做过优化,第三方 harness 可能会消耗更多 token/轮次;低价 contributor 档可能吸引大量重复 batch job,其训练价值存疑。
Gemini 3.8 Flash and 3.8 Flash Cyber#
792 pts · 471 comments · blog.google
📌 内容总结
- Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。前者是 3.7 Flash 的推理/编码升级,价格不变(3.75 per Mtok);后者定位网络安全防御,仅通过 Fairwind Program 提供给受信任方。
- 设计取舍明确:模型在复杂任务上会主动“更努力”,执行额外推理步骤并反复调用工具;需要控制成本时可调低 effort 档位,3.7 Flash 继续保留为效率优先选项。
- Cyber 版在 CWE-Bench pass@1 为 47.2%,对比另一更大前沿模型 47.8%;Google 称 Chrome 安全团队得到的正确补丁数量是其他商业模型的 2.6 倍。
- 发布当天博客一度 404,Model Card 尚可访问;不少用户在 Gemini 应用/Workspace 中看不到新模型,只能从 AI Studio 或 API 使用。
💬 讨论总结
- 评论焦点之一是发布节奏:六周内第三个 Flash 版本;多个评论称 3.5 Pro 已被跳过,预训练已转向 Gemini 4。有人视为“高频迭代”策略,也有人认为只是为 4.0 蓄势。
- 性能实测:Artificial Analysis 给 3.8 Flash 智能分 59,与 Opus 5 medium 同级,DeepSWE 一度登顶;有开发者觉得响应快得不真实,适合原型与规则明确的任务。
- 反对意见集中在生产级 agentic coding:仍不如 Sol/Claude;需要频繁人工批准会抵消速度优势。较常见的用法是把 Flash 当执行层,由 Opus/Sol 做规划和 review。
- benchmaxxing 怀疑有具体数据:Terminal Bench 2 分数很高,但 TBench 4 只有 19.1%(Opus 5 为 51.8%);Model Card 部分安全对比写的是 Gemini 3 Flash 而非 3.7 Flash,统计口径令人生疑。
- Google 的差异化仍被认可:原生音频/视频输入是 OpenAI/Anthropic 旗舰没有的;低价格 + 多模态使其在媒体分析和批量结构化提取上有真实场景。
- 订阅与工具链问题持续被抱怨:发布不即时、Antigravity/Gemini CLI 历史质量不稳、不同账号看到不同模型版本,导致模型能力没有充分转化为用户好感。
- 对 Cyber 变体的安全限制也有异议:研究者抱怨涉及 bio/cyber 的合法任务被越收越紧,反而把用户推向可“去审查”的中国模型。
Can I opt out of my input or output data being used for training?#
359 pts · 155 comments · mistral.ai
📌 内容总结
- 这是 Mistral 官方帮助文档,而非模型发布。核心规则:普通版 Vibe 默认允许训练,Enterprise 版默认不训练;Vibe 与 Mistral Studio/API 的 opt-out 是相互独立的开关。
- 具体控制位置:Vibe 在 Admin panel 的 Manage > Privacy 中关闭
Allow your interactions to be used to train our models;API/Studio 在 Admin panel > Privacy >Anonymous improvement data。 - 文档称一旦关闭,Mistral 不再将新输入/输出用于训练;但对已经进入训练流程的数据如何处理没有说明。
- HN 管理员将提交标题从“Mistral now trains on user input by default, except on enterprise tier”改回官方标题,避免过度解读。
💬 讨论总结
- 最受关注的是 Team/组织场景变化:有人称所在组织选 Mistral 本是为了欧洲隐私与中央控制,结果 Team 计划近期变成默认开启训练,且一度看不到 org 级关闭入口;部分测试 prompt 被训练,投诉后 Mistral 删除了相关数据。
- 该说法被后续回复部分反驳:非 Enterprise 账号至今仍能在 admin.mistral.ai 看到 org 级 toggle;有用户从创建账号起就关闭训练,设置仍保持 off。双方都承认文档与实际设置曾短期不一致。
- 对“默认训练”的反对很强,但存在两种分歧:一种认为 Claude/OpenAI/Gemini 也这么做,Mistral 只是把条款写得更直白;另一种认为 Mistral 长期靠“欧洲/隐私”定位获得市场,现在证明它不比美国同行干净。
- 商业现实被直接讨论:无法获得真实用户反馈就难以追赶前沿模型;用户对话对 Mistral 几乎是必须的训练资源,尤其当它已落后 OpenAI/Anthropic。
- 对法律保护的质疑集中在一处:企业合同若承诺不训练,单方面更改条款能否成立;若只是“vibe”产品线变更,用户很难证明损失。
- 实际经验:第三方入口(如 Kagi、duck.ai)的隐私承诺不等于上游模型厂商的承诺;订阅前需要分别检查 Vibe 与 API 的开关位置,以及当前套餐默认值。
- 个别意见被回复反驳:例如“所有公司都会在后台偷训”被指忽略企业合同违约风险;反过来,“可以 opt out 所以无所谓”也被批评低估了默认值与 UI 深埋对用户的影响。
Anthropic 开源电商 Agent,Muse Spark 1.3 发布
- Anthropic 开源购物与商家双 Agent 实现
- Meta 发布 Muse Spark 1.3,预告开放权重
- Gemini 3.8 Flash 横评:工程成本约为 Opus 5 的 1/7
Anthropic 开源购物与商家双 Agent 实现,并发布 Fable 5.1 去 AI 味提示指南;Meta 同日上线 Muse Spark 1.3,预告开放权重版本;Gemini 3.8 Flash 第三方横评释出,代码任务成本约为 Opus 5 的 1/7。
1. Anthropic 开源 Claude Commerce Agents:落地结论是「少拆 Agent」#
- 核心动作:Anthropic 开源
commerce-agents参考实现,包含面向消费者的购物 Agent(Shopping Agent)与面向店铺运营的商家 Agent(Merchant Agent),覆盖零售、旅行、电信、票务四个行业演示,并提供一个 Claude Code 插件commerce-builder,用/scaffold-commerce-agent等命令针对自有后端生成或审查 Agent。 - 早期效果数据:Anthropic 称,运行在 Claude 上的购物 Agent 让零售商的购物车规模最高扩大 35%,消费者完成购买的可能性提高 60%。
- 架构判断:Anthropic 在多个企业部署后给出的核心结论与“多子 Agent 拆分”的主流直觉相反——商业 Agent 通常应是一个模型、一套循环,配合 Skills 与工具。子 Agent 移交会造成有损状态传递、增加交接延迟,仅适合能独立收口的窄任务;高频规则放系统提示词,长尾能力做成 Skills,工具直接对接现有搜索、库存与结算系统。
- 安全边界:改价、下单、动钱等动作不在提示词里约束,而在代码层分段、限额、校验;模型只能“提议”,执行权留在策略或 Harness 层,写入与渲染只接受服务端签发的 ID,防止幻觉 ID 与第三方注入。
- 行业意义:这是头部实验室首次将电商 Agent 的完整架构决策、成本控制手段与评测方法开源,等于给 Agent 工程化提供了一份可对照的“反直觉”基准线。
2. [持续跟踪] Fable 5.1 发布次日:官方“去 AI 味”提示指南与 /claude-api 审计 Skill 开源#
- 前情提要:昨日 Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取价格从 0.25/M,整体价格下调约 25%,并推出企业前沿安全措施(EFS)。
- 最新突破:Anthropic 发布 Fable 5.1 专属提示工程指南,明确要求“删除所有矫饰性表达”——能用直接陈述时,不用隐喻、漂亮话或表演写作者姿态的语言。社区长期抱怨的 Claudish、Claudese、AI Slop 被官方正式列为待消除项。
- 新工具落地:Anthropic 开源
claude-apiSkill 并内置到 Claude Code,提供三个核心子命令:/claude-api prompt-audit(扫描提示词中的过时反模式)、/claude-api cost-optimize(按实际用量模式给出省钱方案)、/claude-api migrate(按 breaking changes 迁移到新模型),支持 Python、TypeScript、Java 等 8 种语言。 - 现实案例:官方指出,从 Opus 4.8 迁移到 Opus 5 的内部客服基准中,“请双重核对”这类验证仪式会让模型重复劳动浪费 token;“尽可能详尽”类强调语会触发几十次完全没必要的系统搜索。提示词审计因此成为模型升级后的第一道工序。
- 行业意义:模型能力提升后,旧提示词中残留的“脚手架”会反向拖累性能。Anthropic 正把提示词卫生变成可执行的工程工具,而非抽象建议。
3. Meta 发布 Muse Spark 1.3:更克制的工具调用成为新卖点#
- 核心发布:Meta AI 上线 Muse Spark 1.3,针对 Agent 任务与编码做了定向打磨。官方强调它能在单一长对话中同时处理多个工作流,主动补全计划、持续记录已获信息,并在卡住时求助、在重大操作前确认。
- 量化提升:Meta 内部工程师对比显示,相比 Muse Spark 1.2,常见编程工作流中工具调用减少约 20%,Token 消耗减少约 25%,输出更简洁。方向不是“解更多的题”,而是“用更少的资源解同样的题”。
- 能力校准:新模型对自己能力边界的判断更清醒,不再幻觉出一个结果——这对生产环境可信度是直接利好。Meta 强调训练使用了多样化的 harness,避免模型绑定单一 Agent 框架。
- 市场进展:扎克伯格预告 Muse Spark 开放权重版本即将推出。媒体与第三方榜单认为,Muse Spark 1.3 的跑分已进入与 GPT-5.6 Sol、Claude Opus 5 同一梯队的世界前三水平。
- 行业意义:Agent 模型的竞争正从“会不会做”转向“能不能少走弯路、少浪费”。这比单纯刷高分更接近真实生产需求。
4. [持续跟踪] Gemini 3.8 Flash 基准全景:1/7 成本逼近 Opus 5,短板同样明显#
- 前情提要:Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是 6 周内第三个 Flash 版本(3.6 Flash 到 3.8 Flash 间隔约三周)。两款模型共享基础智能,Cyber 版仅通过 Fairwind Program 向受信任防御者开放。
- 工程能力:在 DeepSWE v1.1 上,3.8 Flash 拿到 73.7%,仅比 Claude Opus 5 的 74.0% 低 0.3 个百分点,超过 GPT-5.6 Sol(72.7%)与 Claude Sonnet 5(53.8%),较上代 3.7 Flash 提升 8.4 个百分点。
- 成本效率:在约 73–74% 的准确率下,3.8 Flash 单任务平均成本约 13,Fable 5 约 $15。即长程软件工程任务中,它以约 1/7 到 1/8 的成本实现几乎相同的通过率,处在帕累托前沿。
- 明显短板:不是所有科目都接近前沿。Terminal-bench 4.0 通用 Agent 能力仅 19.1%(Opus 5 为 51.8%);GDPVal-AA v2 知识型工作 Elo 1545,与 Opus 5 的 1824 差距约 280 分,是表中最显著落差。
- 安全特性:3.8 Flash 在 Gray Swan 提示词注入评测中的被攻破率仅 5.5%,而 DeepSeek V4 Pro 为 60.1%、Grok 4.6 为 51.8%。3.8 Flash Cyber 在 CWE-Bench 自动修补中以 47.2% 逼近前沿模型的 47.8%,成本低得多;Chrome 安全团队用它修复了比最佳商用模型多 2.6 倍的漏洞。
- 行业观察:价格用促销价锁定到年底(届时翻倍),加上 Flash 三周一次的节奏与 Pro 系列的沉默形成鲜明对比——Google 正把“工作型模型”当作基础设施高速迭代。
🔗 Google 官方博客 | 第三方成本测算
5. 斯坦福两门新课同开:Agent 从“提示工程”走向“系统工程”#
- 课程发布:斯坦福 2026 秋季学期同时开设两门面向 Agent 的课程——Mihail Eric 的 CS146S《The Modern Software Developer》与斯坦福 NLP 团队(Diyi Yang、Michael Ryan、James Yang,来自 DSPy 与 SWE-agent 项目)的 CS329Z《Engineering AI Agents》。
- CS146S 的激进做法:85% 的旧教材被替换,课程要求学生必须向真实开源项目提交 PR(占成绩 30%),合作方包括 OpenHands、Semgrep、Vercel、Unsloth 等 15 个项目。授课者认为,当 Agent 能生成任何代码时,“判断什么值得做、什么能被真实维护者接受”的软件品味成为核心竞争力。
- CS329Z 的主线:全课围绕分解(decomposition)、数据(data)、评估(evaluation)三大工程挑战展开,覆盖 RAG、工具调用、记忆架构、多 Agent 编排、评估基础设施与安全,并特意对照阅读《Why Do Multi-Agent LLM Systems Fail?》与《Don’t Sleep on Single-agent Systems》。
- 课程设置信号:两门课都明确将课程定位从“用模型”转为“构建与维护 Agent 系统”。作业要求一手建系统、一手设计评测套件,反映业界对 Agent 工程人才的需求已从 Prompt 技巧转向系统级能力。
🔗 CS146S 课程页 | CS329Z 课程页
6. Ramp 数据:OpenAI 与 Anthropic 约 80% 企业收入来自 1% 客户#
- 数据发布:企业支出数据公司 Ramp 最新分析显示,OpenAI 和 Anthropic 约 80% 的企业收入来自前 1% 的客户,且这些头部客户高度集中在科技与 AI 行业本身。
- 风险结构:Ramp 称,这种客户集中度在其追踪的所有软件品类中都属罕见。由于头部客户之间高度相关,一旦市场出现调整,这些公司可能同步收缩 AI 支出,形成收入端的系统性风险。
- IPO 背景:该风险在 OpenAI 与 Anthropic 临近大规模 IPO 的节点尤其值得关注。投资者需要评估的不仅是收入增速,还有收入基座是否过度依赖少数同质化客户。
- 行业意义:这是少有的直接指向“AI 企业收入质量”的第三方数据,把市场叙事从“卖了多少”拉回“卖给谁、是否可持续”。
7. Video Delta Net 开源:视频生成提速 75–90 倍,快于播放速度#
- 技术发布:研究者发布 Video Delta Net(VDN),用混合注意力机制在不损失画质的前提下,将 MiniMax-H3 的视频生成速度提升 75–90 倍——在 8× NVIDIA B200 上,生成 14 秒 768p 视频仅需 11 秒,快于视频本身播放。
- 优化路径:该工作将 Delta Net 的递归状态压缩思想引入视频生成,替代部分全注意力计算,使长视频生成摆脱逐帧自回归的延迟瓶颈。
- 开放性:模型权重、训练代码与推理代码均已开源,并提供技术博客解读。这是继 MiniMax H3 全链路开源后,视频生成开源生态的又一次提速。
- 行业意义:当生成速度快于播放速度,实时互动视频、直播级生成内容的生产成本结构将发生改变——生成视频将从“渲染任务”变成“可交互的实时服务”。