Yeekal Logo Yeekal
4,215 字
早报 | MORNING 2026-08-17

Stripe 70亿美元收购OpenRouter,美团发布CatPaw

今日要点
  • Stripe 超70亿美元收购 AI 聚合平台 OpenRouter
  • 美团发布 CatPaw,内部已搭建 3 万个 Agent
  • Anthropic 公开系统提示词,Opus 5 达 3000+ 词
Stripe 以超70亿美元收购 AI 聚合平台 OpenRouter,后者数月前估值约13亿美元;美团发布全场景 AI Agent 平台 CatPaw,基座 LongCat 2.0 为已开源万亿参数模型,内部覆盖9万员工、搭建3万个 Agent;Anthropic 公开 claude.ai 系统提示词,Opus 5 已达3000+词。

1️⃣ [持续跟踪] Qwen 3.8 27B 深度评测:本地模型惊艳,但默认推理强度“离谱”#

  • 前情提要:阿里 Qwen 上周开源 Qwen3.8-27B,Apache 2.0 协议,27B 多模态、262K 原生上下文,发布当日获得 SGLang、vLLM、Ollama 等适配。
  • 最新突破:Simon Willison 发布长文评测,在 M5 Max MacBook Pro 与 DGX Spark 上实测。模型默认 xhigh 推理强度导致“壮观地过度思考”:生成一张 pelican 骑自行车 SVG 耗时 21 分钟、消耗 22,276 个推理 token;关闭推理后同样任务 137 秒完成。但开启推理时生成的 SVG 质量极高,边界框识别精准,并能驱动 Pi 编码 Agent 完成真实仓库任务(如将 JSONL 转录转成 Markdown)。
  • 性能优化:配合 llama.cpp 的 MTP 投机解码,吞吐可提升约 72%;Unsloth 的 GGUF 量化版 17GB 即可本地运行。
  • 行业意义:17GB 文件即可在本地实现视觉、工具调用与代码生成,但默认推理强度是糟糕的起点——小模型的可用性取决于推理档位的精细调节。

🔗 Simon Willison 博客 | Ollama 支持

2️⃣ [持续跟踪] Anthropic 文本水印发布数日,开源清除工具已获 1 万星#

  • 前情提要:Anthropic 上周公开 Claude 文本水印技术细节,确认采用 Google DeepMind 的 SynthID-Text 方案,并宣布全系输出全球统一嵌入水印。
  • 最新突破:MIT 许可的开源仓库 watermarks-remover 在上线数天内获得 10,000+ stars,可去除 Claude、SynthID-Text 与 OpenAI 文本水印,并支持清理图片和 PDF 中的 C2PA/EXIF 元数据。
  • 对抗细节:Claude 水印不增加 token、无隐藏字符,但逐词重写可去除;该工具正是针对这类可逆性设计。
  • 行业意义:AI 内容溯源从“发布即合规”进入“发布即对抗”阶段,水印技术的鲁棒性成为下一轮竞争焦点。

🔗 AI Breakfast 报道 | watermarks-remover

3️⃣ Agentic Harness 形态之争:Patrick Collison 批评终端,Harrison Chase 详解“脑手分离”#

  • 核心讨论:Patrick Collison 公开表示,Agentic coding harness 不应以终端为主要形态,终端信息密度低、UI 能力有限,应像 Jupyter 之于 REPL 一样走向更高带宽的界面。
  • 架构回应:LangChain 创始人 Harrison Chase 详解 deepagents 设计:Agent 循环与“后端”完全分离,后端只需暴露文件系统式操作(读/写/编辑),可以是真实目录、数据库、对象存储或沙箱;本地 TUI、云端 IDE、Slack 可连接同一个后端,实现“大脑与双手分离”。
  • 行业共识:Addy Osmani 赞同并补充,终端和桌面应用都太“低带宽”,云原生 harness 是方向,现有工作已大量指向这一趋势。
  • 行业意义:Agent 工具链正从“终端优先”转向“多前端 + 云端执行 + 统一后端”的架构范式,UI 形态与执行环境开始解耦。

🔗 Harrison Chase 推文 | Addy Osmani 推文

4️⃣ GitHub Copilot 代码审查新增 Balanced 深度并正式 GA#

  • 功能更新:GitHub 宣布 Copilot code review 的 Balanced 深度正式全面可用。用户可为 PR 选择 Balanced(更深入分析)或 Lite(简单改动快速审查),并可在组织或仓库级别设置默认深度。
  • 行业意义:AI 代码审查从“有/无”进入“可调深度”阶段,审查成本与覆盖范围开始由团队按场景灵活配置。

🔗 GitHub 官方推文

5️⃣ 美团发布 CatPaw:搭载 LongCat 2.0 的全场景 AI Agent 平台#

  • 核心发布:美团正式上线全场景 AI Agent 平台 CatPaw,基座为已开源的万亿参数模型 LongCat 2.0(总参数 1.6T,五万张国产算力卡完成全流程训练)。
  • 能力覆盖:移动端、PC 端、云端三端协同,支持文件操作、浏览器控制、终端命令;内置“专家与技能”体系,可一键录制高频操作生成专属技能;支持多 Agent 并发执行与跨会话长期记忆。
  • 落地数据:CatPaw 已在美团内部覆盖 9 万员工,搭建 Agent 3 万个;Managed Agents 支持数字员工部署到飞书、企微,预置本地生活行业模板。
  • 行业意义:国产算力训练出的万亿模型首次大规模落到企业内部 Agent 平台,验证了从“能训练”到“用得好”的完整闭环。

🔗 美团技术博客

6️⃣ 美团开源 LoHoSearch 与 MineExplorer:Agent 评测转向长程真实任务#

  • LoHoSearch:基于 762 万实体知识图谱自动生成搜索难题,替代人工出题。544 道人工核验题目中,最强模型 GPT-5.5 准确率仅 34.74%,正确轨迹平均工具调用次数达 61 次,显著高于 BrowseComp。
  • MineExplorer:首个开放世界分钟级长程任务评测基准,在 Minecraft 动态环境中评测多模态模型。813 个人工验证实例,最好模型 Claude-Opus-4.6 整体成功率仅 41%,4-hop 任务跌至 12%;近 60% 失败源于导航。
  • 行业意义:两个基准分别打击“搜索智能体”和“多模态具身模型”的评测饱和问题,长程、动态、隐藏前置条件成为下一代 Agent 评测的关键词。

🔗 LoHoSearch 博客 | MineExplorer 博客

7️⃣ [持续跟踪] GLM 5.3 安全能力获 Vercel 实测:开源新前沿,成本为闭源 1/3#

  • 前情提要:智谱昨日发布 GLM-5.3,所有提升来自后训练强化学习,权重预计两周后开源。
  • 最新突破:Vercel CEO Guillermo Rauch 公布实测结果:GLM 5.3 是 DeepsecBench 上得分最高的开源模型,达到相似分数闭源模型的约 1/3 成本,意味着防御性安全任务(如 deepsec.sh)可运行至少 3 倍频次。
  • 行业意义:网络安全防御成为开源模型性价比优势最快兑现的领域,低成本可重复扫描将改变漏洞治理的节奏。

🔗 Guillermo Rauch 推文 | Vercel 推文

8️⃣ 晚点聊:蒸馏竞赛——AI 公司不愿公开谈论的技术捷径#

  • 核心话题:晚点 LateTalk 推出“蒸馏风暴”专题,梳理 2026 年蒸馏技术出圈的背景:智能体轨迹让可“蒸”数据极大丰富,大规模蒸馏的 know-how 集中在账号、真实问题与数据管线。
  • 关键分歧:字节张一鸣明确“不蒸馏”,判断学生模型最多只能逼近、很难真正超越教师模型;其他中国 AI lab 则在积极采用。播客同时讨论了蒸馏违反用户协议、如何隐藏行为、学生能否超过教师等商业与技术问题。
  • 行业意义:蒸馏从模型压缩手段升级为前沿竞赛的隐形变量,头部实验室的路线分歧将影响下一代模型的能力分布与商业逻辑。

🔗 小宇宙播客

9️⃣ [持续跟踪] 扎克伯格“个人超级智能”宣言引发解读:赋权叙事与商业边界的张力#

  • 前情提要:扎克伯格 8 月 10 日发布长文《The Future is for Everyone》,提出 Personal Superintelligence 愿景:AI 应成为每个人的老师、教练与助理,并以“balance of power”理念主张让所有人拥有自己的超级智能。
  • 最新进展:爱范儿刊发深度分析,梳理扎克伯格描述的一人公司、个人生物学家等未来职业,同时指出 Meta 在隐私问题上的历史记录与当前叙事之间的张力——个人 Agent 由 Meta 训练和运行,最终依赖的是平台还是自己的 AI,成为核心追问。
  • 行业意义:Meta 以“个人赋权”框架争夺 AI Agent 的形态定义权,与 OpenAI/Anthropic 的“中心化安全”路线形成鲜明对照。

🔗 爱范儿报道

🔟 LlamaIndex 推出 LlamaExtract Agentic Plus:长文档抽取准确率 94%+,超越通用编码 Agent#

  • 核心发布:LlamaIndex 发布 LlamaExtract Agentic Plus,面向 50 页以上、含 10k-100k 字段的长文档批量抽取,准确率 94%+,每个字段附带置信度与来源边界框。
  • 对比数据:官方称其比 Claude Code Opus 4.8 与 Codex GPT-5.6 等通用编码 Agent 准确率高 10-20%;在 FTX 债权人矩阵(75k 字段、114 页)等极端文档上完成验证。
  • 行业意义:垂直任务专用 harness + 模型组合正在超越通用 Agent,文档抽取从“能读”走向“可审计的高精度提取”。

🔗 Jerry Liu 推文 | LlamaIndex 博客

⭐ GitHub 趋势#

  • 今日无显著 AI 相关趋势

🟧 Hacker News 热议#

Claude: System Prompts#

502 pts · 212 comments · claude.com

📌 内容总结

  • Anthropic 公开 claude.ai 与移动端 App 使用的系统提示词,API 不受影响;提示词随版本迭代,4.6 代起模型为固定快照
  • 提示词规模显著膨胀:早期约 300 词,Opus 5 已达 3000+ 词
  • Opus 5 提示词中内置了 Fable 5 安全路由机制的冗长说明(约 <5% 会话触发),用于处理用户选择了 Fable 5 但请求被重定向至 Opus 5 的困惑
  • 限制:未公开工具定义(tool definitions);Claude Code 的系统提示词也未发布

💬 讨论总结

  • 共识:提示词像建筑规范和合同一样随时间累积——每发生一次安全事故或被利用的漏洞,就新增一条规则
  • Simon Willison 维护了提示词变更的 git 历史;Opus 4.8 → 5 的 diff 显示新增了 Fable/Mythos 因美国商务部出口管制暂停访问、随后恢复的说明(训练数据截止后的事件)
  • 争议点:为什么不把行为直接训练进模型、省去每轮上下文开销?多数回复认为不成立——提示词可热更新、可针对性调整,且前缀缓存大幅降低了成本
  • 被反复质疑的指令:提示词要求 “brief and concise”、避免 “genuinely/honestly” 等词,但多个用户反馈实际输出与指令明显不符
  • 历史对比:最早的系统提示词完全没有安全护栏条目,现在的版本包含多条儿童安全与危机干预规则
  • 个别批评:提示词中存在内生矛盾,可能降低整体输出质量;Anthropic 只公布 web/app 提示词、隐瞒工具定义和 Claude Code 提示词,透明度有限

🔗 原文 · HN 讨论页

Models Are Getting Dumber on Purpose#

226 pts · 133 comments · w4g1.dev

📌 内容总结

  • 核心论点:模型厂商在刻意用世界知识换取推理能力——这是设计目标,不是缺陷
  • 支撑数据:Qwen3.5 9B 幻觉率 80–82%;DeepSeek V4-Flash 仅 13B 激活参数;对比 2023 年 GPT-4 约 280B 激活参数、AIME 几乎无法解题
  • 论据:事实知识约每参数 2 bit 存储,推理是可压缩的程序性技能;训练好的模型内事实会快速过期(API 变更、人事变动),而推理过程不会腐化
  • 预测结论:知识外置到 harness(RAG、工具调用)后,2-3 年内 20–40B 参数模型(4-bit 量化)可在 24GB 消费级显卡上达到 frontier 级推理;且外部化的知识让幻觉从”不可检查的权重错误”变成”可定位、可修复的数据 bug”

💬 讨论总结

  • 主要反驳:把知识移出权重并不能解决幻觉。模型在 RAG 提供正确上下文的情况下仍可能错误输出;“模型需要知道自己不知道什么”这个前提恰恰是未解决的问题
  • 基准有效性受质疑:SimpleQA 已于 2025 年 9 月停更,文中”当前最佳”的 Gemini 2.5 Pro 是 16 个月前的模型,不能支撑”事实回忆仍然很差”的结论
  • 多位数位用户(至少 3 条独立评论)指出文章为 AI 生成(Pangram 检测 100%),且部分论据过时,削弱了可信度
  • 概念争议:推理与事实能否真正分离?评论者认为对世界(如战争、人类行为)的推理依赖具体事实知识,纯程序性推理无法覆盖
  • 硬件假设受质疑:24GB VRAM 的显卡并非主流(Steam 调查约 7%),多数用户只有 8–16GB
  • 补充观点:检索依赖是脆弱环节——搜索质量持续下降;可插拔知识库的想法实际上就是 RAG/MCP/skills 的另一种表述
  • 个别认可:如果模型明确知道自己不知道、并触发工具调用,方向是成立的,但文章没有解释如何做到这一点

🔗 原文 · HN 讨论页

Stripe Clinches over $7B Deal to Buy AI Firm OpenRouter#

133 pts · 87 comments · bloomberg.com

📌 内容总结

  • Bloomberg 报道 Stripe 以 70 亿美元以上收购 AI 模型聚合平台 OpenRouter;原文被 CAPTCHA 拦截,细节有限,以下信息来自标题与社区讨论
  • 背景:OpenRouter 数月前刚以约 13 亿美元估值完成融资;OpenRouter 自身是 Stripe 支付客户
  • 作者/评论者引述:OpenRouter CEO 此前曾自称”AI 领域的 Stripe”——单一 API key 对接多家模型提供商,按使用量抽成

💬 讨论总结

  • 估值争议:一个 API 中间层为何值 70 亿美元(超过 Lyft、Dolby、Alaska Airlines 市值)?回复认为 LLM 调用轨迹数据、以及接入大量模型(含中国模型)的通道价值是支撑点
  • 战略逻辑共识:Stripe 与 OpenRouter 商业模式同构——在碎片化生态前提供统一入口并收取便利费;收购可同时降低 OpenRouter 的支付成本、增加 Stripe 收入
  • 另一种解读:这是支付量防御。OpenAI 本周刚宣布从 Stripe 转投 Adyen;OpenRouter 与 OpenAI 合计占 Stripe 处理量约 5%,失去这类客户对 Stripe 是真实威胁
  • 更长期的想象:Stripe 可能将 OpenRouter 扩展为”token 基础设施”——用户购买 token、跨服务使用,Stripe 负责结算与分成。支持者认为 Stripe 的 API 工程能力适合做这件事;反对者认为 OpenRouter 技术壁垒低、7B 定价过高,且存在郁金香泡沫风险
  • 用户侧担忧:收购后免费 DeepSeek 接入可能消失(被反驳:免费策略由模型提供商而非 OpenRouter 控制);有人建议开始寻找替代品
  • 对照数据:fal.ai 刚以 80 亿美元估值融资,流量约为 OpenRouter 的 1/5,但媒体模型利润率远高于 LLM 代理

🔗 原文 · HN 讨论页


## 今日洞察

模型权重的职责正在收缩。Anthropic 公开的系统提示词从约300词增至Opus 5的3000+词,官方选择热更新而非重新训练,因为前缀缓存让成本可接受。HN那篇《Models Are Getting Dumber on Purpose》虽论据有瑕疵,但“用世界知识换推理能力是设计目标”赢得共鸣。LlamaExtract也用专用harness在长文档抽取上比Claude Code/Codex高10-20%——任务知识、行为规则、工具流程正在从权重迁往外部层。评估标准因此重写:参数规模和知识面的权重下降,推理质量与生态兼容性上升,小模型加外部管道正在侵蚀通用大模型的市场份额。

Stripe 70亿美元收购OpenRouter,估值比数月前13亿翻逾五倍。讨论纠结“一个API中间层为何这么贵”,但这更像支付防御:OpenAI本周刚转投Adyen,而OpenRouter与OpenAI合计约占Stripe处理量5%。更长延伸是,Stripe有动机把OpenRouter做成token结算层,将模型调用变成可跨服务结算的计量单位。模型分发入口正在变成AI时代的支付网关,开发者对单一聚合层的依赖风险与免费模型接入的可持续性都会被重新定价。
2,001 字
晚报 | EVENING 2026-08-17

Stripe 70亿美元收购OpenRouter,OpenAI 12位高管年内离职

今日要点
  • Stripe 超 70 亿美元敲定 OpenRouter 收购
  • OpenAI 年内已有 12 位高管离职
  • RealReplicaBench 电商评测 13 款模型全不及格
Stripe 超 70 亿美元敲定 OpenRouter 收购;OpenAI GPU 工程师 Scott Gray 离职,年内已有 12 位高管离开;RealReplicaBench 显示 13 款模型电商任务全未及格;DeepSeek 涨价致 OpenCode Go 额度缩水 70%。

1️⃣ [持续跟踪] Stripe 超70亿美元敲定 OpenRouter 收购#

  • 核心亮点:支付巨头 Stripe 以超 70 亿美元价格敲定对 AI 模型聚合平台 OpenRouter 的收购,知情人士称最终价格可能仍有变动。
  • 前情提要:上月彭博社首次曝出双方进入收购谈判,彼时报价约 100 亿美元;OpenRouter 今年 5 月 B 轮融资估值仅 13 亿美元。
  • 最新突破:交易状态从”谈判中”推进到”已敲定协议”,对价定为 70 亿美元以上;OpenRouter 拥有 800 万用户、接入 400 多款模型,创始人 Alex Atallah 曾将其定位为”AI 模型领域的 Stripe”。
  • 行业意义:模型分发与 Token 结算被打包定价,连接模型供需的聚合层在数月内完成近 5 倍估值跃升;收购后 OpenRouter 能否保持模型中立性将成为开发者关注焦点。 🔗 爱范儿早报 | 小互推文

2️⃣ [持续跟踪] OpenAI 资深 GPU 工程师 Scott Gray 离职,年内高管流失增至 12 人#

  • 前情提要:OpenAI 此前已被曝出自 4 月以来至少 9 位核心高管离职,包括前 COO Brad Lightcap、Sora 负责人 Bill Peebles 等。
  • 最新突破:2016 年加入、参与稀疏 Transformer、Scaling Laws 与 GPT-3 底层 GPU 系统建设的 Scott Gray 近日离开;Business Insider 统计 OpenAI 2026 年已有 12 位高层离职,名单新增 CRO Denise Dresser、应用 CEO Fidji Simo、安全系统负责人 Johannes Heidecke、伦理负责人 Chloé Bakalar、硬件与机器人负责人 Caitlin Kalinowski 等。
  • 行业意义:相比商业高管,十年以上资历的底层系统工程师更难替代;GPU 基础设施能力直接决定训练与推理效率,IPO 前夜的人才持续流失为 OpenAI 的治理与稳定性再添变数。 🔗 AI Will 转述 | 原推整理

3️⃣ RealReplicaBench:13 款模型在电商真实任务中全部未及格#

  • 核心亮点:脱胎于阿里 Accio Work 团队的电商 Agent 基准 RealReplicaBench,用 107 个真实商业任务考核 13 款模型,最高分 Claude Opus 5 仅 56.1 分。
  • 评测设计:任务源自 160 万完整对话、20 万商业轨迹与 2000 条高价值工作流;Verifier 直接读取环境状态(Shipment ID、Jira Task、Dashboard)而非模型自我报告,未完成任务一律记 0 分。
  • 关键发现:供应商采购需从约 300 封高噪声邮件中还原业务事实;跨系统任务要求将 5383 条海关记录同步映射到 Google Workspace、Box 与 Jira。模型在长链路任务上普遍无法完成”可交接的交付”。
  • 行业意义:Agent 评测从”考交规”转向”路考”,harness 建设能力与底层模型能力开始被同时打分;当前模型在真实商业工作流中的完成度仍有明显缺口。 🔗 爱范儿深度报道

4️⃣ [持续跟踪] DeepSeek 涨价连锁反应:OpenCode Go 额度缩水 70%,Cola 同步调价#

  • 前情提要:DeepSeek 将 V4 Pro 缓存命中输入价格上调超 12 倍,综合涨幅 3-6 倍,API 改为峰谷定价。
  • 最新突破:OpenCode 官方宣布 Go 套餐限额已按新价格调整,V4 Flash 额度缩水约 70%,并透露内部推进”Operation Cheepseek”压低成本;Cola Token Plan 同步将 Flash 与 Lite 模型价格整体上调约 3 倍。
  • 行业意义:以低价策略打开市场的模型大幅涨价后,依赖差价生存的第三方 Token 订阅与转售服务被迫重构定价,围绕 DeepSeek 的开发者工具链进入成本重估周期。 🔗 Geek 推文 | Orange.ai 推文

5️⃣ AI 积分转售经济:未使用 API 额度成为灰色市场#

  • 核心亮点:调查报告揭开了 AI API 积分灰色转售市场——经纪人收购初创公司未使用额度后打折转卖,流通规模估计达数千万美元。
  • 市场形态:AI Credits、AICreditMart 等平台提供 30-80% 折扣,卖家通过代理池转发请求而非直接移交密钥;有卖家声称日供应量达 10 万美元。
  • 风险提示:高折扣货源可能涉及被盗 API 密钥、被盗信用卡或自动化注册的试用账户;第三方转售存在模型替换与数据泄露风险。
  • 行业意义:API 额度事实上成为可交易的”准货币”,灰色市场的规模与滥用风险将推动模型提供商收紧检测与代理追踪机制。 🔗 Vectoral 原文 | HN 讨论

6️⃣ Grok Bot 的四项技术决策:无 UI、常开电脑、浏览器操作#

  • 核心亮点:Lee Robinson 将 Grok Bot 的架构选择归纳为四条原则,称其为少数按当前前沿模型能力而非传统产品惯性设计的产品。
  • UI 取舍:最好的 UI 就是没有 UI,短信式交互层远简于同类产品,且不会随模型能力提升而失效。
  • 端云分工:客户端只承担消息收发,复杂度全部放在服务端 harness,桌面与移动端因此保持流畅。
  • 常开电脑:Agent 连接自己的云端持久文件系统,而非每次对话新建 VM,类似用 Tailscale 从手机连回家里电脑。
  • 浏览器能力:编码 Agent 把工作表达为代码,但登录网站、点击界面等任务需真实浏览器完成,Grok Bot 已能执行这类操作。
  • 行业意义:Coding Agent 的形态正从”本地终端会话”切换到”云端常驻个人计算机”,交互入口、执行环境与工具边界同时被重新定义。 🔗 Lee Robinson 推文

7️⃣ Dario Amodei:公众反对 AI 本质上是信任危机#

  • 核心亮点:Anthropic CEO Dario Amodei 回应投资人 Gavin Baker 批评,否认自己只强调风险,称公众对 AI 的负面态度本质上是信任危机。
  • 争论背景:Baker 认为 Amodei 对 AI 风险的持续警告加剧了公众反弹,削弱了行业争取监管支持的能力。
  • Dario 回应:自己的文章对风险与收益投入相当篇幅;“AI 将治愈癌症”已成为套话,只有真正的科学成果才能改变公众态度。
  • 监管立场:反对把选择简化为”无监管分发 AI”或”监管把能力集中到少数公司”;开放权重只是把权力集中点转移给拥有最多算力的人。 🔗 爱范儿早报节选

8️⃣ 美团 KDD 2026:8 篇论文入选,DataAgents 赛道夺冠#

  • 核心亮点:美团技术团队 8 篇论文被 KDD 2026 收录,并在 KDD Cup DataAgents 赛道获得冠军与季军。
  • 论文覆盖:MTFM 推荐基座大模型已在外卖等场景全量上线;LocalSearchBench 构建本地生活 Agent 搜索评测基准;JTransNet 联合广告拍卖模型已全量上线零售核心场景。
  • 比赛思路:将”问点仔”Agent Harness 迁移至赛题,构建多模态视频理解子智能体与文档 ETL 子智能体,加入错误反馈、超时控制与自动重试机制。
  • 行业意义:工业界真实业务积累开始直接参与国际顶级学术会议与竞赛,复杂异构数据分析 Agent 的能力从论文走向可复用的开源代码。 🔗 美团技术博客 | KDD Cup 冠军代码