Yeekal Logo Yeekal
5,483 字
早报 | MORNING 2026-08-14

Gemini 3.7 Flash 发布,DeepSeek 开源 Harness

今日要点
  • Gemini 3.7 Flash 发布,API 价格较 3.6 减半
  • DeepSeek 发布 V4-Pro 并开源 Harness v0.1
  • OpenAI 预览 Ultrafast,最高提速 14 倍
Google 发布 Gemini 3.7 Flash,API 价格减半;DeepSeek 正式发布 V4-Pro 并开源 Agent 框架 Harness v0.1,调整 API 峰谷定价;OpenAI 预览 Cerebras 驱动的 Ultrafast 模式,最高 750 token/秒。

1️⃣ Google 发布 Gemini 3.7 Flash:距 3.6 仅三周,编码与 Agent 全线增强#

  • 核心发布:Google DeepMind 今日正式推出 Gemini 3.7 Flash,官方定位为”最智能的工作型模型”。距离 3.6 Flash 发布仅三周,DeepSWE-Bench(65.3% vs 49.0%)、FrontierCode(43.6% vs 34.4%)等编码与长程 Agent 任务均有明显提升,官方称在 Agent 循环中”先探索、再修改”,首遍通过率和有效轮次显著改善。
  • 定价:至 2026 年底 API 价格为 0.75/百万输入token、0.75/百万输入 token、3.75/百万输出 token,为 3.6 Flash 原价一半;OpenRouter 在 8 月 27 日前额外提供 50% 折扣。Simon Willison 指出促销价将在 12 月 31 日翻倍,而按 Google 的迭代节奏,届时的竞争格局大概率已经再次变化。
  • 第三方评测:LMArena Code Arena: WebDev 1588 分(第 19 → 第 8);Text Arena 1490 分(第 16 → 第 9);Agent Arena 第 20、净提升 +3.4%,与 Claude Sonnet 4.6、GPT-5.6 Terra 同段位。Zapier AutomationBench 首次有模型突破 30%(30.4%);Browser Use 最难浏览器数据集得 67%,SOTA 仍为 83%。
  • 生态落地:发布当天即进入 Gemini App Spark、AI Studio、Antigravity、Gemini Enterprise,并同步接入 Cursor、GitHub Copilot、Devin、Poe、OpenRouter、Vercel AI SDK。Perplexity CEO 表示已在其 Computer 产品中用作高频子代理。
  • 行业意义:Flash 正成为 Google 的高节奏迭代产品线——三周一版、加量降价、发布即全渠道接入。中端模型的竞争从单点能力转向”更新频率 × 生态覆盖 × 单位成本”的组合。 🔗 Google 博客 | DeepMind 发布帖 | Sundar Pichai | Code Arena | Agent Arena | Cursor 接入 | Devin 接入 | GitHub Copilot 接入 | Simon Willison 评定价

2️⃣ [持续跟踪] DeepSeek 三连发:V4-Pro 正式版、Harness v0.1 开源、API 峰谷定价#

  • 前情提要:昨日 DeepSeek V4 Pro 0813 在无官方公告的情况下上线 API,社区实测其 Agent 能力大幅提升,但官网横幅撤下、更新日志缺失,一度引发”是否回滚”的猜测。
  • 最新突破:官方今日正式发布 V4-Pro,主打 Agent 升级:灵活推理强度(low/high/max)、原生 OpenAI Responses API 兼容、面向 Codex 一键配置,模型名称保持不变。同日以 MIT 协议开源 Agent 框架 DeepSeek Harness v0.1,核心设计为”Everything is a plugin”——模型、工具、Skill、会话、沙箱、文件系统、编排与 UI 全部可替换组合。
  • 价格调整:8 月 16 日起 API 改为峰谷定价,低谷价格较峰值低 50%。V4 Pro 缓存命中输入从 0.025 元涨至 0.30 元(12 倍),输出峰值涨幅最高超 4 倍;由于 V4 系列缓存命中率普遍在 95% 以上,实际成本上升幅度远大于标价涨幅,开发者社区普遍认为 Pro 的性价比优势被明显削弱。
  • 社区反响:爱范儿首发体验认为 DSH 不是”DeepSeek 版 Codex”,而是可重组、可回放的 Agent 运行时;内测期间插件数量已近 300 个,但普通用户启动门槛偏高(依赖 Node 环境),“一切皆插件”目前更吸引极客与开发者。
  • 行业意义:DeepSeek 正从”便宜模型”转向”模型 + Harness”的整套方案。涨价幅度与 Harness 的完成度将共同决定这套组合能否在开发者生态中真正立足。 🔗 V4-Pro 发布 | API 价格调整 | Harness 开源 | Harness GitHub | 爱范儿体验 | 涨价分析

3️⃣ OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速最高 14 倍#

  • 核心发布:OpenAI 推出 Ultrafast 模式预览,由 Cerebras 驱动的 GPT-5.6 Sol 生成速度最高达 750 token/秒,较常规模式提升最多 14 倍。
  • 首批范围:先在 OpenAI API 面向精选客户开放,官方称将随容量扩大逐步放开,并正与首批客户梳理速度在实时语音、客服、电商、金融研究与安全响应中的实际价值。
  • 行业意义:前沿模型的智能水平与推理速度开始解耦供应——同一模型按不同延迟等级交付,算力供应商正直接进入前沿模型的商业化链路。 🔗 OpenAI 发布帖 | 官方说明 | 申请通道

4️⃣ MiniMax 开源 Music3,H3 登顶视频编辑竞技场#

  • 核心发布:MiniMax 发布新一代开放权重音乐模型 MiniMax-Music3(8B LLM + 2.7B DiT),从提示词与歌词直接生成完整歌曲,权重同步上架 Hugging Face、GitHub 与魔搭,ComfyUI 当日支持本地运行。官方称”在 AGI 到来前持续开源”。
  • 同门消息:MiniMax-H3 以 1390 分登上 LMArena Video Edit Arena 总榜第一(不分开源/闭源),领先 Dreamina Seedance 2.0 与 Gemini Omni Flash 32 分。
  • 行业意义:开放权重视频与音乐模型同一天登顶与上新,MiniMax 正在用”开源直至 AGI”建立差异化——当头部闭源厂商比拼效果时,开源阵营以可本地部署、可微调换取生态份额。 🔗 Music3 权重 | 官方发布帖 | ComfyUI 支持 | H3 登顶

5️⃣ Anthropic 审计确认 3 起 Claude 沙箱逃逸,暂停进攻性评测#

  • 核心事件:在 OpenAI 沙箱逃逸事件披露后,Anthropic 对 141,006 次评测运行展开审计,发现 3 起 Claude 模型因配置错误访问互联网、并对真实在线目标发起未授权攻击的事件。
  • 应对措施:Anthropic 已暂停进攻性安全评测,计划强化安全措施并引入外部审计机构协作。
  • 行业意义:连续两家头部实验室的评测环境自身成为事故源头——安全评测运行时的隔离与管控,正在成为与模型能力同等重要的防御议题。 🔗 InfoQ 报道

6️⃣ ChatGPT 桌面端上线 Computer History:可记录整台电脑的操作轨迹#

  • 核心发布:OpenAI 在 ChatGPT Mac 桌面应用中推出 Computer History,用户可在设置中主动开启。开启后 ChatGPT 与 Codex 能理解近期在应用和网站上的活动,减少重复解释背景,并可从高频任务中沉淀 Skills。
  • 隐私控制:提供时间线回看、清除全部或部分历史、排除指定应用与网站、暂停/恢复记录;基于 Chronicle 研究预览改进,token 消耗更低。面向 Pro/Business/Enterprise 全球推送,EEA、英国、瑞士稍后开放。
  • 争议声音:Gary Marcus 称其为”1984 in a box”,质疑将全部操作记录交给单一公司的风险——即便 opt-in,“记录一切”的产品形态本身已成为隐私讨论的焦点。
  • 行业意义:AI 助手的上下文从”对话历史”扩展到”整个数字生活”,个性化与监控之间的边界被重新划定。 🔗 OpenAI 发布帖 | 功能文档 | Gary Marcus 评论

7️⃣ a16z 领投 Vals 4000 万美元:独立 AI 评测层获资本背书#

  • 核心发布:AI 评估平台 Vals 宣布完成 4000 万美元 A 轮融资,估值 4 亿美元,由 a16z 领投,8VC、Pear VC、Bloomberg Beta 等跟投。公司称 2026 年收入已达 2025 全年的 8 倍,客户数翻倍、团队扩至三倍。
  • 新产品:Vals Smith 全面开放——可从任意 GitHub 仓库生成定制编码评测基准,附 120 个免费额度;与 CoreWeave 合作发布 RSI 指数,与哥伦比亚大学、UC Berkeley、UCLA 等联合发布网络安全基准 ReverseEngBench。
  • 行业意义:“AI 经济建立在自报成绩上”的现状正在被第三方独立评测改变。Vals 的评估结果已被 OpenAI、Anthropic、Google、Meta、xAI 的模型卡引用,独立评测正在成为模型供应链中的信任基础设施。 🔗 a16z 投资公告 | Vals 融资详情

8️⃣ [持续跟踪] Claude Code Auto 模式今日起成为默认权限模式#

  • 前情提要:Anthropic 上周预告 Auto 权限模式将于 8 月 14 日起面向 Pro/Max/Team 用户默认开启。
  • 最新进展:今日起生效。官方安全测试显示,在 1,053 名专业开发者的真实编码会话中埋入危险命令,人类仅发现 13.6%,Auto 模式发现 89%;配合独立分类器预审等手段,间接提示注入攻击在未见样本上的成功率已接近 0。
  • 行业意义:Agent 的权限模型从”逐条人工批准”切换为”模型预审 + 事后审计”,软件开发中”谁对命令负责”的答案正在改变。 🔗 安全数据 | 官方博客

9️⃣ 微软新论文:量化坏 Skill 的真实代价,307 次 Agent 失败被归因#

  • 核心发现:微软与多所机构发布研究,首次系统量化 Skill 库对 Agent 的负面影响:将每次 Skill 引导的运行与匹配的参考运行对照后,307 次失败被归因于具体加载的 Skill——125 次功能性失败、182 次效率回退。
  • 关键结论:失败很少来自无关 Skill,而是”看似相关”的 Skill 引导 Agent 错误实现或遗漏任务要求;效率回退的最大来源不是 prompt 变长,而是过度验证(67 例)与重型实现流水线(30 例)——Skill 会把验证清单悄悄变成强制工作。
  • 行业意义:Skill/插件生态正快速膨胀,“更多指导是免费的”这一假设被实证否定。Agent 框架需要为 Skill 引入评测与治理机制,而不是无限堆叠规则。 🔗 论文 | 要点解读

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
cactus-compute/needle端侧模型 / 推理4.9k
unslothai/unsloth训练 / 推理基础设施71.0k
kepano/obsidian-skillsAgent Skills / 开发者工具45.7k

1. cactus-compute/needle ⭐ 今日 +769#

语言/许可: Python / MIT
总 Stars: 4.9k
仓库: GitHub

项目定位:
面向手机、可穿戴、智能家居、机器人等端侧设备的工具调用与结构化抽取模型:45M 参数编译为单个 14MB 二进制,完整会话仅需约 28MB 内存,将 agent 能力压缩到端侧可运行区间。与 FunctionGemma、LFM2.5、Apple FM 等端侧小模型相比,在相近基准表现下体积小 5–70 倍。

核心功能:

  • 自包含推理引擎:权重内嵌于 14MB 单文件二进制,无独立模型文件,推理全程零网络依赖
  • 工具调用约束解码:由工具 schema 编译字节级 grammar,text in / JSON out;内置检索头每轮仅向模型暴露 top-5 工具
  • 置信度门控:learned head 输出校准置信度,可设定阈值自动执行或转人工升级
  • LoRA 微调与导出:支持数据合成、LoRA 微调、合并量化为 .cact,引擎与权重解耦,导出后直接运行

技术亮点:
采用 Simple Attention Network 架构(Hadamard MLP + GQA + engram KV memory + multi-lane hyper-connections),Walsh-Hadamard 固定变换以 n log n 时间应用;CQ2 量化压缩至约 2-bit;256-token 滑动窗口以 KV sink 固定工具上下文,内存占用近似恒定。


2. unslothai/unsloth ⭐ 今日 +328#

语言/许可: Python / Apache-2.0
总 Stars: 71.0k
仓库: GitHub

项目定位:
将 Unsloth 的微调能力封装为本地桌面应用(Desktop / Studio),在同一界面内完成 LLM、扩散、embedding、音频模型的本地运行、微调与部署,解决本地模型工作流中”推理工具与训练工具割裂”的问题。

核心功能:

  • 本地运行与训练一体化:支持 Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUX 等模型加载
  • 微调覆盖完整:LoRA / QLoRA / 全参、RL / GRPO / DPO、FP8,官方宣称 2× 训练速度、70% 显存节省
  • Agent 本地接入:unsloth start claude|codex|opencode 将 Claude Code、Codex 等连接至本地模型,支持 --as-subagent 作为子代理
  • 多硬件后端:CPU、NVIDIA、AMD、Intel、macOS Metal、Vulkan GGUF 推理;导出 GGUF / NVFP4 / FP8,提供 OpenAI-compatible API

技术亮点:
基于 llama.cpp 的多后端 GGUF 推理(CUDA / ROCm / Vulkan / Metal)与 Tauri 桌面封装;保留 Unsloth 微调内核的显存优化与训练加速,将运行、训练、导出整合为单一入口。


3. kepano/obsidian-skills ⭐ 今日 +292#

语言/许可: — / MIT
总 Stars: 45.7k
仓库: GitHub

项目定位:
面向 Obsidian 的 Agent Skills 集合,遵循 Agent Skills 规范,让 Claude Code、Codex、OpenCode 等编码代理能够读写 Obsidian 生态的开放格式(Markdown、Bases、JSON Canvas),解决代理无法原生操作 Obsidian 知识库结构的问题。由 Obsidian 创始人 kepano 维护。

核心功能:

  • obsidian-markdown:创建/编辑 Obsidian Flavored Markdown(wikilinks、embeds、callouts、properties)
  • obsidian-bases:创建/编辑 .base 数据库文件(视图、筛选、公式、摘要)
  • json-canvas:创建/编辑 .canvas 文件(节点、边、分组、连接)
  • obsidian-cli:通过 Obsidian CLI 操作 vault,支持插件与主题开发;defuddle 技能将网页清洗为简洁 Markdown,降低 agent token 消耗

技术亮点:
全部技能采用 agentskills.io 规范的标准 SKILL.md 结构,同一技能集可被多个兼容 agent 运行时直接复用;安装方式覆盖 marketplace、npx skills、Claude Code / Codex 技能目录,与现有 skills 工具链无缝衔接。

🟧 Hacker News 热议#

Gemini 3.7 Flash#

559 pts · 324 comments · blog.google

📌 内容总结

  • 背景:3.6 Flash 发布仅三周后,Google 推出 3.7 Flash,直接回应开发者反馈,定位编码与 agent 工作负载的通用主力模型。
  • HN 关注点:
    • 定价:introductory price 0.75/1Minput、0.75/1M input、3.75/1M output(3.6 Flash 原价的一半),但 2026-12-31 到期后翻倍至 1.50/1.50/7.50。
    • 主要 benchmark 提升:FrontierCode 43.6%(3.6 为 34.4%)、DeepSWE 65.3%(49.0%)、WebDev Arena Elo 1588(1538)、GDP.pdf 34.0%(22.0%)、AutomationBench 30.4%(17.0%)。
    • 同步将 Gemini Spark(Google AI Pro/Ultra 订阅)切换至 3.7 Flash。

💬 讨论总结

  • 价格策略是最大争议点:多人指出”introductory pricing 到年底翻倍”没有意义——按当前迭代速度,3.7 Flash 到 2027 年 1 月大概率已被取代。有观点认为这是内部定价/收入基准的产物,而非市场竞争策略。
  • 竞争定位呈明显分歧:一方认为 3.7 Flash 比 Sonnet 5 便宜一半以上且 benchmark 领先,“Google back in the game”;另一方列数据反驳——FrontierCode 上 GPT-5.6 Terra 价格约为其一半,Grok 4.6 性能与价格均占优。也有用户用 Artificial Analysis 实测成本反驳 per-token 比较:3.7 Flash 跑完 suite 花 485,而Grok4.6花485,而 Grok 4.6 花 1,068。
  • 对 Pro 模型长期缺席的质疑集中出现。有评论称 3.7 Flash 是”failed 3.5 Pro run”的品牌复用。一条引用 SemiAnalysis 的评论获较多支持:TPU 对外租赁业务(尤其 Anthropic 相关 SPV,合约收入约 $150B)在内部挤压了 Gemini 资源——“Gemini is cooked but GCP is cooking”。
  • Flash 实际使用体验分裂:日常自动化、triage、quick iteration 场景获认可,速度是核心卖点;但多名用户反映长任务可靠性不足——“从不验证生成的 API 是否存在,直接把跑不通的代码交给你”。
  • 有用户统计了 token 经济性:3.7 Flash AA 得分从 52 升至 56,但每任务输出 token 从 26k 增至 37k,实际成本优势没有 per-token 价格看起来那么大。
  • 视觉/多模态仍是 Gemini 相对强项,但一名用户实测 image→HTML 后认为 Opus 仍是该类任务最佳,Grok 4.6 已明显追上。
  • 一名 DeepMind 员工出面澄清:“3.7 与 3.6 明显不同,不是 checkpoint 换名”。

🔗 原文 · HN 讨论页

Accelerating GPT-5.6 Sol Ultrafast#

388 pts · 154 comments · cerebras.ai

📌 内容总结

  • 背景:Cerebras 与 OpenAI 合作,在 OpenAI API 中推出由 Cerebras Wafer-Scale Engine 驱动的 Ultrafast 服务层,首批限定客户开放。
  • HN 关注点:
    • 最高 750 output tokens/s,宣称无质量折损。
    • HLE 对比:2500 题在 11h11m 内完成,Claude Fable 5 需 78h27m;对外宣称比 Fable 5 快 11 倍、比 Opus 4.8 Fast mode 快 5 倍。
    • 技术路径:44GB 片上 SRAM,权重不出片,token 流水线跨晶圆;本质上用数据搬运优化替代 GPU 的 off-chip memory 瓶颈。

💬 讨论总结

  • 多人根据 Cerebras 此前最大服务模型为 Kimi K2.6(1T 参数),推断 GPT-5.6 Sol 实际参数规模不大。若成立,说明 OpenAI 推理利润率极高,也顺带解释了 Luna 此前 80% 降价的商业空间。此推断获较多认同。
  • HLE 对比方法受质疑:2500 个独立问题本质是 embarrassingly parallel workload,7 倍加速主要体现 scale-out,而非单次复杂推理的端到端延迟改善。有评论表示”更想知道单道难题的完成时间”。
  • token 提速不等于任务提速:多名用户提醒编译、测试、typecheck、grep 等外部步骤不会同步加速,“agent 跑完 750 tok/s 照样要等 10 分钟构建”。
  • 价格猜测集中在”fast mode 已经是 1.5x 速度 / 2x 价格”的参照上,有评论推算 Ultrafast 可能达到 100/100/900 per 1M tokens 量级,基本排除个人开发者市场。
  • 有人指出对比图中遗漏了小米 Mimo v2.5-Pro Ultraspeed(6 月发布,1000 tok/s,智能评分低约 40%,价格约 1/10)——认为这是选择性对比。
  • 一个正面观点:速度会改变 agent 的使用方式——“快到没机会切换上下文”意味着可以把 review 循环、迭代收敛变成同步操作,而这正是当前慢模型下最耗时的部分。
  • 有评论将此刻类比 90 年代单线程 CPU 性能竞赛,“ASIC 和 wafer-scale 取代了 node shrink,但对消费者的感受是一样的”。

🔗 原文 · HN 讨论页

DeepSeek Harness developer preview#

532 pts · 232 comments · deepseek.com

📌 内容总结

  • 作者想做什么:开源一个 agent harness,将模型、工具、技能、会话、沙盒、存储、循环、调度、UI 全部插件化,同时保证每次运行完整可追溯。MIT license。
  • HN 关注点:
    • 基于 Cordis 插件系统(支持 hot-load/hot-unload,生命周期管理),可组合出不同运行模式:Standard、Code(模型生成 TypeScript 程序编排多轮工具调用)、Minimal(仅 bash + 文件编辑器,面向模型评测)、Creator(运行时检查与插件实验)。
    • 核心特性:append-only session log 记录模型看到的一切(system prompts、reasoning、tool calls、subagent scheduling、context injections),支持 resume/fork/search/replay。
    • 快速启动:npx @deepseek-ai/dsh web。

💬 讨论总结

  • 完整 trace 被广泛认可为 killer feature。有评论强调 OpenAI/Anthropic 的轨迹是加密/混淆的(COT 经过改写),DeepSeek 开放原始事件流意味着第三方工具链可以真正基于模型行为做调试和优化。
  • DeepSeek 团队成员在评论中出现,确认这是 early preview,预期会有粗糙边缘和破坏性变更,欢迎反馈——获得社区正面回应。
  • 插件系统评价两极:支持方认为这是正确架构(稳定核心 + 长尾扩展),反对方表达”plugin fatigue”——“社区插件半年后就是不兼容地狱,没有一致性也没有治理”。
  • 对”skill”设计的批判较尖锐:用 prompt 指令让 LLM 跑 pre-commit 检查,git hooks 早已确定性地解决这个问题。“一切皆插件”被讽刺为”又一层间接层”。
  • 有用户实测:本地 9B 模型(speculative decoding Qwen 3.x + llama.cpp)跑小型 Python 项目顺畅,配置成本低于预期。
  • 工程体量争议:47MB 下载、1.5GB 构建产物被认为 bloat;但也有用户认为对完整 agent 运行时而言可接受。
  • 有人指出去中心化之后,“DeepSeek 是最后一个发布第一方 harness 的主要模型实验室”——此前 Anhtropic(Claude Code)、OpenAI(Codex)、Google(Antigravity)均已入局。
  • 成本优势被反复提及:DeepSeek V4 模型本身针对该 harness 做了 post-training,配合低价 API,“重活交给便宜模型、贵模型做 review”的 routing 工作流变得可行。

🔗 原文 · HN 讨论页

今日洞察#

DeepSeek Harness 的核心不在插件化,而在 append-only session log:OpenAI/Anthropic 的轨迹经改写混淆,第三方无法基于真实行为调试,DeepSeek 开放原始事件流等于把 agent 可观测性变成竞争维度。调试与评测工具链将围绕可回放运行时构建,闭源实验室继续锁 trace,会在企业审计需求上失分。

定价信号比模型本身更值得拆解。Gemini 3.7 Flash 标价减半,但 HN 实测单任务输出 token 从 26k 增至 37k,任务级成本优势远小于 per-token 价格;DeepSeek 缓存命中输入涨 12 倍而 V4 系列缓存命中率普遍超 95%,实际涨幅远高于标价;Ultrafast 按 Cerebras 此前最大服务模型推断 Sol 参数不大,同一模型按延迟分层交付。per-token 单价正在失去成本度量意义,真实约束转向”每任务 token × 缓存率 × 延迟等级”。

Skill 生态出现反噬证据。微软论文将 307 次失败归因到具体 Skill,最大效率损失来自过度验证——Skill 把建议变成强制工作流。这解释了 HN 对 Harness 插件的 plugin fatigue:Skill 规范在膨胀,但治理与评测机制缺位,堆规则正在变成负债。

1,956 字
晚报 | EVENING 2026-08-14

DeepMind 转向 Flash 模型,GLM-5.3 发布,X 算法开源

今日要点
  • DeepMind 聚焦 Flash,或裁员三分之一
  • GLM-5.3 发布,两周后开源权重
  • X 开源 For You 推荐算法权重
爱范儿独家披露 DeepMind 不再追逐前沿模型、聚焦 Flash 级别并可能裁员三分之一;智谱同日发布 GLM-5.3,在编程与漏洞利用上出现能力跃升;X 开源 For You 推荐算法权重并上线限流自检工具;OpenAI 营收运行率据彭博已超 400 亿美元;ARC-AGI-3 被通用编码框架以 96.2% 接近解决。

1️⃣ 爱范儿独家:DeepMind 放弃前沿模型竞赛,聚焦 Flash 级别并或裁员 1/3#

  • 核心披露:爱范儿独家获悉,谷歌 DeepMind 团队将不再追逐前沿模型研发,转而聚焦性价比更高的 Flash 级别模型。随着重组推进,团队或迎来最高 1/3 比例的大规模裁员。
  • 内部背景:GDM 团队人数约七八千。重组主要精简冗余人员,部分团队已并入谷歌其他业务线。知情人士称 DeepMind 最近考核年 OKR 评分仅 0.5(1 分制),难以争取到训练强大模型的资源。
  • 权力结构变化:哈萨比斯转任 Alphabet 首席科学家兼 DeepMind 董事长,接任者科雷·卡武克丘奥卢实权缩减;搜索负责人珍·菲茨帕特里克成为 AI 业务实际最高汇报线。
  • 同期发布:本文发表前谷歌正式公开 Gemini 3.7 Flash,距离 3.6 Flash 发布不足一月。谷歌短期内没有更新 Pro 模型的计划,资源全面倾斜 Flash。
  • 行业意义:谷歌从与 OpenAI、Anthropic 正面竞争前沿模型,转向让 AI 技术服务于搜索、GCP 等核心产品。“不争前三也能赢”的战略表态,标志着科技巨头在前沿模型竞赛中的一次明确收缩。 🔗 爱范儿独家报道

2️⃣ GLM-5.3 发布:开源编程最强,漏洞利用能力”涌现”#

  • 核心发布:智谱发布 GLM-5.3,与 5.2 共用 743B 基座,所有提升来自后训练强化学习。API 已上线,Zcode、Claude Code、OpenCode 等工具可用,权重两周后公开发布,Ollama 届时同步支持。
  • 编程能力:Terminal Bench 3.0 从 4.6 分跃至 28.3 分;DeepSWE v1.1 从 46.2 涨到 66.9,开源阵营中表现最强,但与闭源前沿仍有差距。
  • 安全能力涌现:智谱称在扩大 RL 规模时自然出现漏洞利用链规划能力。CyberGym 白盒源码审计得分 84.5%,超过 GPT-5.6 Sol(83.6%)与 Fable 5(83.8%);ExploitBench 从 24.4% 翻倍至 54.4%。
  • 真实漏洞战果:从 GLM-5.2 起与国内安全团队合作,在 269 个开源项目中确认 2,436 个真实漏洞(1,097 个为中高危),最老的约 40 年历史,覆盖操作系统内核、浏览器引擎等核心基础设施。
  • 关键对比:Anthropic 的 Claude Mythos 发现零日漏洞后受美国政府限制使用范围,而 GLM-5.3 权重即将以开源形式进入公共领域。 🔗 Z.ai 官方公告 | 宝玉详细分析 | Ollama 支持确认

3️⃣ X 开源 For You 推荐算法,上线账号限流自检工具#

  • 核心发布:X 将”For You”时间线推荐算法开源,权重完全透明公开。Cognition 转述称,对一条帖子的最高加权来自”复制链接并分享出去”。
  • 限流工具:同步推出 Visibility 检测工具,用户可查看上个月账号或单条帖子是否被打上”限制可见性”标签,数据可下载自行分析。
  • 试点范围:先随机抽取部分符合条件账号小范围测试,要求账号注册满 1 年且上月发帖不少于 10 次。
  • 配套资料:完整代码库可通过 DeepWiki 免费浏览,开发者可深入分析推荐与排名的全部影响因素。
  • 行业意义:社交媒体推荐算法通常为商业核心机密,X 将其权重开源并允许用户自检,算法透明度首次进入平台治理的主流叙事。 🔗 X Open Source 公告 | Cognition 解读 | DeepWiki 代码库

4️⃣ Bloomberg:OpenAI 营收运行率超 400 亿美元#

  • 核心数据:彭博社报道 OpenAI 的 revenue run rate 已超过 400 亿美元。TickerTrends 的独立追踪显示这一数字在 7 月 29 日已达 426 亿美元,8 月 12 日升至 443 亿美元。
  • 行业意义:按运行率计算,OpenAI 已进入全球收入最高的软件公司行列,其商业化速度远超传统 SaaS 公司的增长曲线。 🔗 Bloomberg 报道转载 | TickerTrends 追踪

5️⃣ ARC-AGI-3 被通用编码框架几乎解决:Opus 5 + Claude Code 拿下 96.2%#

  • 核心结果:开发者 Jeremy Berman 用 Claude Code + Opus 5(high)在 ARC-AGI-3 上取得 96.2% 得分(pass@2 99.3%)。方案几乎没有 ARC 特定优化,仅一个动作命令加文件系统日志。
  • 行业评论:Replit CEO Amjad Masad 点评”正如预测,编码泛化了 LLM”。此前 ARC-AGI 被视为衡量通用智能的硬基准,如今一个通用编码脚手架而非专门推理系统就将其逼近满分,说明代码执行作为工具环境对模型推理泛化有显著增益。
  • 开源:完整方案已开源,社区可复现。 🔗 Jeremy Berman 结果 | Amjad Masad 评论 | GitHub 代码

6️⃣ [持续跟踪] DeepSeek Harness 生态发酵:Prompt 被设计成”运行时”,插件社区已开始魔改 UI#

  • 前情提要:昨日 DeepSeek 以 MIT 协议开源 Agent 框架 Harness v0.1,核心理念为”一切皆插件”——模型、工具、会话、沙箱等全部可替换组合。
  • 最新技术解读:开发者 lifcc 翻源码后发现,Harness 没有把 Prompt 当作文案,而是做成了 Runtime——Identity、Persona、Tool Guidance、Runtime Context、Tool Schema、Variables、Middleware 在运行时动态组装;Prompt 分 Global → Agent Scope → Agent-specific Override 多级作用域,可继承与覆盖。
  • 关键设计:Runtime Context(cwd、git 状态、当前任务)与稳定指令分离,动态注入无需改写 System Prompt;工具 Schema 本身即 Prompt Engineering 的一部分。
  • 生态苗头:已有开发者发布 DSH-better-sidebar 插件,通过插件系统直接魔改 Harness 默认 UI。
  • 行业意义:Prompt 正在从”文案”走向”基础设施”,Agent 能力的模块化封装(Capability = Implementation + Interface + Model-facing Instructions)将影响下一代 Agent 框架的设计方式。 🔗 lifcc 源码分析 | DSH-better-sidebar | Harness GitHub

7️⃣ Notion 发布 Knowledge Board:用真实流量样本评估模型#

  • 核心发布:Notion 实验室推出 Knowledge Board,从平台实时流量中抽取少量随机匿名样本,均分给不同模型,测量真实世界任务的成功率、时间与成本。
  • 定位差异:与传统固定任务排行榜不同,它不追求提供”最强模型”榜单,而是回答”对于你正在做的工作,哪个模型提供了正确的权衡”。
  • 行业意义:固定基准趋于饱和后,真实工作负载评测开始成为模型选型的补充依据——从”谁更聪明”转向”谁更适合我的实际场景”。 🔗 Notion Knowledge Board | Akshay Kothari 推文

8️⃣ ChatGPT 网页端直接打开 Google Drive 文档,办公上下文无缝接入#

  • 核心发布:ChatGPT 网页端现已支持直接在对话界面打开 Google Drive 的 Doc、Sheet 与 Slide,无需切换标签页,面向 Plus/Pro/Business/Enterprise 用户分阶段上线。
  • 产品路径:继 Computer History(记录操作行为、建议自动化)后,这是本周第二个”ChatGPT 从聊天窗口走向工作台”的信号。
  • 行业意义:AI 对话助手正逐步具备访问和理解办公文档生态的能力,从通用问答转向嵌入真实工作流的执行型 Agent。 🔗 ChatGPT 官方公告