Yeekal Logo Yeekal
3,905 字
早报 | MORNING 2026-08-24

Altman 承认 AI 采用慢于预期,Anthropic 收入 65 亿美元

今日要点
  • Altman 承认 GPT-4 后企业软件被颠覆判断有误
  • Anthropic 年化收入65亿,Fable5 支出占8%
  • DeepMind Recirc 不重训提升 GSM8k 21%
Altman 承认 GPT-4 后软件被颠覆判断有误,AI 采用慢于预期;FT 称 Anthropic 收入 65 亿美元,Fable 5 占8%,上代占28%;DeepMind Recirc 让 Gemma3 困惑度降23%。

1. Sam Altman 承认 AI 采用速度慢于预期,LeCun 与 Gary Marcus 公开反驳#

核心亮点: OpenAI CEO 在访谈中承认 GPT-4 之后“软件业务很快被颠覆”的判断有误,经济系统的惯性让过渡比预期更慢。

  • 在 David Senra 的《Founders》访谈中,Altman 表示原以为 GPT-4 发布后企业软件会迅速被抢占,但“经济就是有这么大的惯性”,人们继续向同一家公司购买、沿用原有工具链;他因此认为“所有人都对时间表过于乐观”。
  • Yann LeCun 转引该片段并揶揄:“Sam 突然顿悟现实世界的动力学方程包含惯性和摩擦项。”
  • Gary Marcus 则指出 Altman 只承认采用速度判断失误,却回避了 2025 年 1 月“我们已知道如何构建 AGI”的表态;他说真正的问题是 AGI 仍需多年和多次突破。
  • Altman 在同场对话中还批评 AI 行业“把传播做得最差”,渲染“毁灭世界”和消灭工作的说法让技术显得可怕;Marcus 转发时只回了句 “no shit”。

🔗 Fireside Alpha 视频片段 | Gary Marcus 推文 | Yann LeCun 推文

2. [持续跟踪] FT 披露 Anthropic 年化收入 65 亿美元,Fable 5 支出占比落后于 Opus 4.8#

核心亮点: FT 援引知情人士称 Anthropic 7 月年化收入已达 65 亿美元,但 Ramp 企业账单显示最新旗舰 Fable 5 的支出占比落后于上代 Opus 4.8。

  • 前情提要: 此前 Ramp 数据已显示 OpenAI 企业侧增长反超 Anthropic;Vercel AI Gateway 也记录到开放权重模型 token 占比在两个月内升至 62%。
  • 最新进展: FT 报道 Anthropic 7 月年化收入从 5 月的 47 亿美元升至 65 亿美元,并预计 Q3 实现盈利,目前有 6000 个年花费 10 万美元以上的企业客户。
  • Ramp 的 7 月企业 AI 支出分布中,Opus 4.8 占 28.0%,Fable 5 占 8.0%,Opus 5 只占 3.5%;FT 标题直接称“Anthropic 最好的模型难以吸引用户,更便宜的工具正在蓬勃发展”。
  • Gary Marcus 评论称 Anthropic 尚未“cooked”,但以 2 万亿美元估值投资一家旗舰产品需求下滑、低价产品被大量对手压价的公司“需要检查一下头脑”。
  • Drew Breunig 写道,Fable 很强但太贵,Opus 对多数编码任务已经够用,于是团队开始认真思考“什么工作该交给什么模型”。

🔗 FT 原文 | Simon Willison 分析 | Gary Marcus 评论 | Drew Breunig

3. 斯坦福启动 Marin 535B 开放训练,完整过程对外公开#

核心亮点: Percy Liang 团队开始训练 535B 参数的 Marin 模型,并公开完整训练计划与 scaling ladder。

  • 训练计划:Marin 535B-A23B 将在 11 个 GB200 NVL72 上训练约 3 个月,数据量 18.75T tokens,总计算量 2.7e24 FLOPs;其中 pretraining 占 80%,midtraining 占 20%。
  • 正式开跑前团队先训练了从 1.6B-A61M 到 27.7B-A1.2B 的四级 scaling ladder,用于调试问题并预测最终主 run 的表现。
  • “这是目前我们最大的一次 run,所以肯定要预期意外。” Percy Liang 表示整个过程将保持开放。

🔗 Percy Liang 推文 | Stanford AI Lab 转发

4. Google 开源 HEIR,同态加密 LLM 推理迈向“一键部署”#

核心亮点: Google 发布开源编译器 HEIR,可把面向明文输入训练的模型编译为直接处理加密数据的版本。

  • HEIR(Homomorphic Encryption Intermediate Representation)是编译器和开发工具链,目标是降低加密计算的部署门槛,让同态加密推理不再需要手工改造模型。
  • 该方案对需要在不信任环境使用 LLM 的场景(如医疗、金融)有直接价值:模型可对密文推理,用户无需交出原始数据。
  • InfoQ 评价称,Google 正把同态加密 LLM 推理变成一种“一键式能力”。

🔗 InfoQ 报道

5. [持续跟踪] NVIDIA AI 服务器涨价 15%,内存成本继续向硬件传导#

核心亮点: 英伟达 AI 服务器因内存成本飙升将涨价 15%,单体 1GW 数据中心建设成本预计增加约 50 亿美元。

  • 前情提要: 此轮内存涨价已先传导至云厂商,OVHcloud 部分服务器价格最高上调 87%。
  • 最新进展: 量子位援引产业链信息称,英伟达 AI 服务器价格将上调 15%;内存成本上涨是主因。
  • 涨价将直接影响数据中心建设预算:按 1GW 规模计算,相关成本增加约 50 亿美元。

🔗 量子位报道

6. Cloudflare 开源企业 AI 平台 Cloudflare OS#

核心亮点: Cloudflare 将企业级 AI 工作平台 Cloudflare OS 开源,以 capability-based 模型在安全沙箱中运行可共享、可定制的工作软件。

  • 企业团队可在平台内基于企业知识、经验与已配置连接器产出工作产物,并自动化重复工作流,同时只按需调用 AI 以优化 token 成本。
  • 平台强调个人化、可分享、可定制,面向特定复杂业务场景,所有运行均落在安全沙箱模型中。
  • 这是 Cloudflare 继 Kitesurf、Cloudflare Computer 之后又一款面向 Agent 时代的基础设施开源项目。

🔗 InfoQ 报道

7. a16z:法律行业 Codex 采用量增长 108 倍,AI 重度用户走出科技圈#

核心亮点: a16z 统计显示,自 2 月以来 Codex 在法务、销售、招聘、市场和医疗行业的采用量分别增长 108x、41x、41x、26x 和 24x。

  • a16z 称 AI 重度用户正在科技行业之外出现,Codex 是增长最快的企业级 Agent 产品之一。
  • 数据来自其 “Charts of the Week”,主要追踪企业订阅与应用使用趋势。
  • 该横截面与 Altman “宏观采用速度低于预期”的判断并不冲突:增量正从非研发岗位的重复性知识工作中产生。

🔗 a16z 推文 | Charts of the Week

8. [持续跟踪] Grok Build 向免费用户开放,新增 Extra High Effort 档位#

核心亮点: xAI 将 Grok Build 开放给 X 免费用户,并加入 /effort 最高推理档位供 Grok 4.6 处理困难项目。

  • 前情提要: Grok 4.6 此前已登录 Vertex AI 并登顶 CursorBench;xAI 随后向少量企业开放 Grok Bot 现场部署。
  • 最新进展: XFreeze 宣布免费用户可以直接在 Grok 内构建 App、网站、游戏和仪表盘;通过 /effort 可切换到 Extra High Effort。
  • 马斯克转发了一段对比视频,称 Grok Bot 三个月后的流体力学模拟能力“amazing”。

🔗 XFreeze 推文 | 马斯克转发

9. DeepMind 提出 Recirc:给模型加“循环”,不重训也能显著提分#

核心亮点: DeepMind 论文 Recirc 在推理时向模型注入递归,Gemma3 系列困惑度下降 23%,GSM8k 准确率提升 21%,全程无需重训练。

  • 前馈 transformer 有多少层就能更新多少次内部状态;Recirc 通过在 prefill 阶段把激活值重新送回模型,让模型像动力系统一样跟踪信念状态。
  • 生成成本保持平稳,串行计算集中在 prefill;模型原始权重完全冻结,只需少量超参数调整。
  • 论文采用自适应变体,在 Gemma3 家族上验证效果;作者认为这类“训练无关”架构演化可能启发出更鲁棒的递归自我改进方案。

🔗 论文 | elvis 解读

10. [持续跟踪] 匿名模型 Ox Alpha 被扒出“智谱血缘”#

核心亮点: 量子位通过 tokenizer、视频编码与 API 报错特征推断,OpenRouter 上的匿名模型 Ox Alpha 与智谱 GLM 存在血缘关系。

  • 前情提要: Ox Alpha 此前以匿名身份上线 OpenRouter,提供 1M 上下文与多模态能力;实测 DeepSWE 通过率 58.4%,社区对其地理来源的猜测一度指向美国东海岸后又反转。
  • 最新进展: 量子位对比多项技术特征后认为其与智谱 GLM 相近;同时也有观点怀疑 Cursor 使用了开源 GLM 训练。
  • 目前尚无官方确认,相关判断仍属技术推断。

🔗 量子位报道

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
Alishahryar1/free-claude-codeLLM 网关 / 开发工具47.9k
NousResearch/hermes-agentAI Agent234.9k
block/buzzAgent 协作基础设施30.1k

1. Alishahryar1/free-claude-code ⭐ 今日 +1081#

语言/许可: Python / MIT
总 Stars: 47.9k
仓库: GitHub

项目定位:
面向编码 Agent 的统一模型访问网关,将 Claude Code、Codex、Pi、OpenCode 等 9 个编码代理接入 49 个免费/订阅/本地模型提供商,解决多提供商 Key 管理、模型选择与故障切换问题。

核心功能:

  • 本地代理 + 管理 UI,集中配置 NVIDIA NIM、OpenRouter、Groq、SiliconFlow 等提供商的 Key 与模型映射
  • 为各编码 Agent 提供独立启动器(fcc-claude、fcc-codex 等),保留原生会话、扩展与工具链能力
  • 按序 Fallback:单轮对话内请求失败自动切换下一提供商,不中断任务
  • 输出 token 优化:RTK 过滤常规命令输出,本地处理 quota 探测、命令前缀、标题与文件路径,减少无效模型调用

技术亮点:
本地代理完成多 Provider 协议统一与模型目录抽象,模型对 Agent 原生 /model 选择器透明,客户端零改动即可跨提供商切换。


2. NousResearch/hermes-agent ⭐ 今日 +454#

语言/许可: Python / MIT
总 Stars: 234.9k
仓库: GitHub

项目定位:
具备闭环学习能力的通用 AI Agent 框架,通过”经验→技能→记忆”机制实现跨会话自我改进,面向需要长期自主运行的 Agent 开发者。

核心功能:

  • 自主技能创建与迭代:复杂任务完成后生成技能,使用中持续改进,兼容 agentskills.io 开放标准
  • 多平台统一网关:Telegram、Discord、Slack、WhatsApp、Signal 与 CLI 同一进程接入,支持语音备忘录本地转写
  • 7 种执行后端:本地、Docker、SSH、Singularity、Modal、Daytona、Vercel Sandbox,其中 Modal/Daytona 提供空闲休眠的无服务器持久化
  • 子代理并行编排与 Python RPC 工具调用,将多步流水线折叠为低上下文消耗的单个步骤

技术亮点:
基于 FTS5 会话检索 + LLM 摘要构建跨会话记忆;支持批处理轨迹生成与压缩,可直接产出工具调用模型的训练数据。


3. block/buzz ⭐ 今日 +410#

语言/许可: Rust / Apache-2.0
总 Stars: 30.1k
仓库: GitHub

项目定位:
Block 开源的人机协作工作区:以 Nostr relay 事件日志为统一底座,让人类与 AI Agent 以同一身份模型和审计轨迹共同完成代码评审、CI 与发布流程。

核心功能:

  • 事件溯源架构:消息、评审、审批、工作流步骤、Git 事件均为 Nostr 签名事件,天然形成可搜索审计日志
  • Agent 作为频道成员而非机器人:独立密钥对、独立频道成员关系,权限按身份作用域控制
  • YAML 工作流引擎:消息/表情/定时/webhook 触发,支持审批门控
  • buzz-cli 面向 LLM 工具调用设计(JSON in/out),附带 Goose、Codex、Claude Code 的 ACP harness

技术亮点:
Rust 实现 relay 与桌面端(Tauri),单事件日志统一身份、搜索与审计;通过 NIP-34 将 Git 协作(patch、仓库公告、状态)纳入同一事件流。

🟧 Hacker News 热议#

Anthropic’s best AI model struggles to attract users as cheaper tools thrive#

118 pts · 104 comments · ft.com

📌 内容总结

  • 背景/作者意图:FT 报道,正文位于付费墙后,本次抓取的 link_content 不包含正文内容;仅能从标题确认报道方向:Anthropic 最强模型在用户获取上表现不佳,更便宜的工具正在占据优势。
  • HN 关注点:
    • 无足够原文信息,无法提炼更多具体事实、数据或设计取舍。

💬 讨论总结

  • 未提供具体评论内容(top_comments 为空),无法提炼 HN 社区观点;该帖显示有 104 条评论。

🔗 原文 · HN 讨论页

My agent.md to improve LLM-assisted code quality#

119 pts · 62 comments · fabiensanglard.net

📌 内容总结

  • 背景/作者意图:Fabien Sanglard 分享他用于约束 LLM 编码风格的 agent.md 文件。他从 2025 年对 LLM 编码的负面体验(代码无法编译),到 2026 年 1 月发现 LLM 能写复杂数据结构和定位 obscure bug,但代码质量差;随后通过 agentic IDE 反复给“无限耐心的初级 CS 学生”式反馈,最后把这些重复意见固化进 agent.md。
  • HN 关注点:
    • agent.md 是 coding harness 在会话开始时自动注入 prompt 的指令文件,作者给出了完整规则列表:短函数名(<30 字符)、避免魔法数字、早返回/减少缩进、用 enum 替代 boolean 参数、严格分层边界、commit message 7 条规则、修 bug 先写测试等。
    • 作者明确这不是“银弹”:LLM 仍会幻觉、必须人工 review,但审查重点从代码风格转移到架构与设计。
    • 用“每功能开新 session + 显式 reload agent.md”缓解上下文稀释(Lost in the Middle 现象)。

💬 讨论总结

  • 未提供具体评论内容(top_comments 为空),无法提炼 HN 社区观点;该帖显示有 62 条评论。

🔗 原文 · HN 讨论页

AI Chip Architectures#

12 pts · 0 comments · jepeake.com

📌 内容总结

  • 背景/作者意图:以 Hennessy & Patterson 2018 年图灵讲座 “A New Golden Age for Computer Architecture” 为引子,综述当前 AI 芯片架构设计空间。作者认为理解一款 AI 芯片只需回答四个问题:数据存在哪、如何搬到计算单元、计算单元长什么样、芯片如何扩展到集群。
  • HN 关注点:
    • 核心问题是内存墙与算术强度差异:训练/prefill 是 GEMM(高算术强度),decode 是 GEMV(低算术强度,权重带宽受限);连续批处理、投机解码、多 token 预测用于把 GEMV 重新拉回 GEMM。
    • NVIDIA 路线是“可编程大规模并行 + 持续演进的 Tensor Core/TMA/异步流水线”,护城河是 CUDA 生态与嵌入客户的工程师;TPU 路线是“专用矩阵乘法机 + XLA 静态调度”,无硬件调度器、无缓存、无线程/warp。
    • Scale-up / scale-out 分界明显:NVL72 用无源铜缆做机柜级一致内存域,跨机柜改用光模块/CPO;TPU 用 ICI 3D torus 组成超大 pod。

💬 讨论总结

  • HN 暂无评论。

🔗 原文 · HN 讨论页

1,776 字
晚报 | EVENING 2026-08-24

Hugging Face 寻求 130 亿美元出售,英伟达洽谈投资 Perplexity

今日要点
  • Hugging Face 探索出售,估值至少 130 亿美元
  • 英伟达洽谈投资 Perplexity,估值或超 300 亿美元
  • 阿里 Wan3.0 上线,ChatGPT Search 机制突变
Hugging Face 探索出售,估值至少 130 亿美元;英伟达洽谈投资 Perplexity,估值或超 300 亿美元;阿里发布 Wan3.0 视频模型;ChatGPT Search 的 site: 查询占比激增 45 倍。

1️⃣ Hugging Face 寻求整体出售,估值至少 130 亿美元#

  • 核心事实:据 Business Insider 报道,Hugging Face 已聘请投行摸底潜在买家收购意向,交易估值至少 130 亿美元,谈判仍处早期阶段,最终也可能不卖。
  • 关键转折:2025 年底公司曾拒绝英伟达 5 亿美元投资(对应约 70 亿美元估值),CEO Clément Delangue 多次强调”中立性”是平台生命线;如今主动问价,姿态鲜明转变。
  • 资产与风险:平台托管超 200 万个模型,是开源 AI 生态的默认分发入口。行业分析认为,其真正壁垒是开发者使用习惯与社区黏性;但若落入云厂商或芯片巨头之手,其他玩家是否还愿意在此发布模型将成为最大变量。

🔗 爱范儿报道 | 创业邦报道

2️⃣ 英伟达洽谈投资 Perplexity,估值或超 300 亿美元#

  • 交易动态:The Information 报道,英伟达正在洽谈投资 AI 搜索公司 Perplexity,本轮融资后估值有望突破 300 亿美元。
  • 业务数据:Perplexity 年化收入已超过 7.5 亿美元,今年年初尚不足 2.5 亿;增长主要来自 AI 搜索订阅与电脑端 Agent 产品 Perplexity Computer。
  • 生态意图:Perplexity 今年 3 月已加入英伟达牵头的 Nemotron Coalition。对英伟达而言,这是从 GPU 算力向模型生态、应用入口延伸的一环;对 Perplexity 而言,则是在 OpenAI、Google 挤压下获取算力与生态绑定的机会。

🔗 爱范儿报道

3️⃣ [持续跟踪] GPT-5.6 Sol 降价促销延续,Vercel 称其成增长最快前沿模型#

  • 前情提要:OpenAI 此前将 GPT-5.6 Sol 的 API 价格下调约 20%(输入 5→4 美元/百万 token,输出 30→20 美元),促销至少持续至 11 月 21 日。
  • 最新进展:Vercel CEO Guillermo Rauch 今日表示,Sol 在 Vercel AI Gateway 上已成为增长最快的前沿模型,并评论”智能正在变便宜”——推理成本下降时,用量增长明显,需求弹性很高。
  • 行业意义:这为模型降价如何传导为实际调用量提供了最新数据点,也解释了网关/路由层近期升温的原因——价格波动正成为开发者必须管理的基础设施变量。

🔗 Rauch 推文 | 爱范儿早报

4️⃣ 阿里视频生成大模型 Wan3.0 正式上线#

  • 核心发布:8 月 24 日,阿里巴巴视频生成大模型 Wan3.0 正式上线,行业评价”稳定、真实、有质感”。
  • 行业影响:Wan 系列此前已广泛应用于国内 AI 视频生成工具链,3.0 的发布将直接影响视频生成模型的竞争格局。

🔗 量子位报道

5️⃣ ChatGPT Search 底层机制突变:site: 查询占比 45 倍激增#

  • 数据变化:Promptwatch 监测显示,8 月 8 日后 ChatGPT Search 的 site: 定向查询占比从日均 0.368% 升至 16.78%,放大近 45.5 倍。
  • 机制推测:ChatGPT Search 新流程可能改为”先全网发现候选来源,再锁定特定域名寻找文档、规则和更新”,对特定站点做定点搜刮。
  • GEO 影响:网站获得 AI 引用的竞争变成两层——域名先入选,页面再争取引用。可抓取、可核验的一手内容体系成为基础门槛。

🔗 小互推文 | 分析原文

6️⃣ 小米发布玄戒芯片与 AI 本地主机,支持 120B 双模型#

  • 沟通会:小米今日 14 点以图文直播举行玄戒芯片技术沟通会,负责人朱丹介绍最新进展,距首款旗舰处理器亮相已 459 天。
  • 硬件发布:会上公布 AI 本地主机,搭载自研 O3、O100、D100 三颗芯片,支持 120B 与 3B 双模型运行,可切换快慢系统。
  • 背景:玄戒 O1 已在三款终端累计出货超 100 万颗,新芯片将战场从手机延伸到本地 AI 推理场景。

🔗 爱范儿早报 | 歸藏推文

7️⃣ Claude Code Remote Control 新增服务器模式,手机可发起本地会话#

  • 功能更新:Anthropic 为 Claude Code Remote Control 加入服务器模式——开发者在电脑上运行 claude remote-control 后,即可从 Claude 手机 App 或网页端发起新的本地会话。
  • 关键设计:会话仍在用户自己的电脑上执行,本地文件、MCP、工具与项目配置不迁移云端;默认最多承载 32 条并发会话,可选择共享目录或为每条任务创建独立 Git worktree。
  • 可用性:目前处于研究预览阶段,支持 Pro、Max、Team 与 Enterprise 计划;Team/Enterprise 管理员需先启用,不支持 API Key 登录。

🔗 爱范儿早报

8️⃣ Netflix 公开 LLM Judge 生产级生命周期:四阶段 + A/B 验证#

  • 论文内容:Netflix 详述其 LLM 评判器在生产中的完整生命周期——Birth(多标准评估 + 人工标注基准)、Training(基于推理的 rubric 对齐调优)、Deployment(同一评判器兼作质量门禁与反思式生成)、Monitoring(人在回路漂移检测与重训)。
  • 规模数据:该体系每周处理数十万条剧集级推荐解释,覆盖移动端数百万会员。
  • 验证结果:五周 A/B 测试显示,对照无解释组,推荐解释将观看行为导向此前未看内容,并提升浏览到播放的成功转化,且无质量相关投诉。

🔗 论文 | elvis 推文

9️⃣ 阿里达摩院发布肝癌诊断 AI 模型 DAMO LiON#

  • 核心发布:达摩院联合中国医科大学附属盛京医院等机构研发的肝癌诊断 AI 模型 DAMO LiON 正式公布,可精准识别 1 厘米微小肿瘤。
  • 落地价值:这是影像 AI 在肿瘤早筛方向的明确进展,有助于肝癌早期发现与诊疗路径优化。

🔗 量子位报道

🔟 [持续跟踪] 英伟达 AI 服务器明年涨价超 15%#

  • 前情提要:内存成本持续上涨,英伟达此前已向大客户预警 AI 服务器将提价。
  • 最新进展:彭博社报道,搭载英伟达 AI 芯片的服务器将在很多配置上提价超 15%,从 2027 年初出货系统生效,覆盖 Vera Rubin 与 Grace Blackwell 平台,具体涨幅取决于芯片代际与内存配置。
  • 传导路径:涨价将沿芯片 → 服务器 → 云厂商 → 开发者链条继续传导。

🔗 爱范儿早报