Altman 承认 AI 采用慢于预期,Anthropic 收入 65 亿美元
- Altman 承认 GPT-4 后企业软件被颠覆判断有误
- Anthropic 年化收入65亿,Fable5 支出占8%
- DeepMind Recirc 不重训提升 GSM8k 21%
Altman 承认 GPT-4 后软件被颠覆判断有误,AI 采用慢于预期;FT 称 Anthropic 收入 65 亿美元,Fable 5 占8%,上代占28%;DeepMind Recirc 让 Gemma3 困惑度降23%。
1. Sam Altman 承认 AI 采用速度慢于预期,LeCun 与 Gary Marcus 公开反驳#
核心亮点: OpenAI CEO 在访谈中承认 GPT-4 之后“软件业务很快被颠覆”的判断有误,经济系统的惯性让过渡比预期更慢。
- 在 David Senra 的《Founders》访谈中,Altman 表示原以为 GPT-4 发布后企业软件会迅速被抢占,但“经济就是有这么大的惯性”,人们继续向同一家公司购买、沿用原有工具链;他因此认为“所有人都对时间表过于乐观”。
- Yann LeCun 转引该片段并揶揄:“Sam 突然顿悟现实世界的动力学方程包含惯性和摩擦项。”
- Gary Marcus 则指出 Altman 只承认采用速度判断失误,却回避了 2025 年 1 月“我们已知道如何构建 AGI”的表态;他说真正的问题是 AGI 仍需多年和多次突破。
- Altman 在同场对话中还批评 AI 行业“把传播做得最差”,渲染“毁灭世界”和消灭工作的说法让技术显得可怕;Marcus 转发时只回了句 “no shit”。
🔗 Fireside Alpha 视频片段 | Gary Marcus 推文 | Yann LeCun 推文
2. [持续跟踪] FT 披露 Anthropic 年化收入 65 亿美元,Fable 5 支出占比落后于 Opus 4.8#
核心亮点: FT 援引知情人士称 Anthropic 7 月年化收入已达 65 亿美元,但 Ramp 企业账单显示最新旗舰 Fable 5 的支出占比落后于上代 Opus 4.8。
- 前情提要: 此前 Ramp 数据已显示 OpenAI 企业侧增长反超 Anthropic;Vercel AI Gateway 也记录到开放权重模型 token 占比在两个月内升至 62%。
- 最新进展: FT 报道 Anthropic 7 月年化收入从 5 月的 47 亿美元升至 65 亿美元,并预计 Q3 实现盈利,目前有 6000 个年花费 10 万美元以上的企业客户。
- Ramp 的 7 月企业 AI 支出分布中,Opus 4.8 占 28.0%,Fable 5 占 8.0%,Opus 5 只占 3.5%;FT 标题直接称“Anthropic 最好的模型难以吸引用户,更便宜的工具正在蓬勃发展”。
- Gary Marcus 评论称 Anthropic 尚未“cooked”,但以 2 万亿美元估值投资一家旗舰产品需求下滑、低价产品被大量对手压价的公司“需要检查一下头脑”。
- Drew Breunig 写道,Fable 很强但太贵,Opus 对多数编码任务已经够用,于是团队开始认真思考“什么工作该交给什么模型”。
🔗 FT 原文 | Simon Willison 分析 | Gary Marcus 评论 | Drew Breunig
3. 斯坦福启动 Marin 535B 开放训练,完整过程对外公开#
核心亮点: Percy Liang 团队开始训练 535B 参数的 Marin 模型,并公开完整训练计划与 scaling ladder。
- 训练计划:Marin 535B-A23B 将在 11 个 GB200 NVL72 上训练约 3 个月,数据量 18.75T tokens,总计算量 2.7e24 FLOPs;其中 pretraining 占 80%,midtraining 占 20%。
- 正式开跑前团队先训练了从 1.6B-A61M 到 27.7B-A1.2B 的四级 scaling ladder,用于调试问题并预测最终主 run 的表现。
- “这是目前我们最大的一次 run,所以肯定要预期意外。” Percy Liang 表示整个过程将保持开放。
🔗 Percy Liang 推文 | Stanford AI Lab 转发
4. Google 开源 HEIR,同态加密 LLM 推理迈向“一键部署”#
核心亮点: Google 发布开源编译器 HEIR,可把面向明文输入训练的模型编译为直接处理加密数据的版本。
- HEIR(Homomorphic Encryption Intermediate Representation)是编译器和开发工具链,目标是降低加密计算的部署门槛,让同态加密推理不再需要手工改造模型。
- 该方案对需要在不信任环境使用 LLM 的场景(如医疗、金融)有直接价值:模型可对密文推理,用户无需交出原始数据。
- InfoQ 评价称,Google 正把同态加密 LLM 推理变成一种“一键式能力”。
🔗 InfoQ 报道
5. [持续跟踪] NVIDIA AI 服务器涨价 15%,内存成本继续向硬件传导#
核心亮点: 英伟达 AI 服务器因内存成本飙升将涨价 15%,单体 1GW 数据中心建设成本预计增加约 50 亿美元。
- 前情提要: 此轮内存涨价已先传导至云厂商,OVHcloud 部分服务器价格最高上调 87%。
- 最新进展: 量子位援引产业链信息称,英伟达 AI 服务器价格将上调 15%;内存成本上涨是主因。
- 涨价将直接影响数据中心建设预算:按 1GW 规模计算,相关成本增加约 50 亿美元。
🔗 量子位报道
6. Cloudflare 开源企业 AI 平台 Cloudflare OS#
核心亮点: Cloudflare 将企业级 AI 工作平台 Cloudflare OS 开源,以 capability-based 模型在安全沙箱中运行可共享、可定制的工作软件。
- 企业团队可在平台内基于企业知识、经验与已配置连接器产出工作产物,并自动化重复工作流,同时只按需调用 AI 以优化 token 成本。
- 平台强调个人化、可分享、可定制,面向特定复杂业务场景,所有运行均落在安全沙箱模型中。
- 这是 Cloudflare 继 Kitesurf、Cloudflare Computer 之后又一款面向 Agent 时代的基础设施开源项目。
🔗 InfoQ 报道
7. a16z:法律行业 Codex 采用量增长 108 倍,AI 重度用户走出科技圈#
核心亮点: a16z 统计显示,自 2 月以来 Codex 在法务、销售、招聘、市场和医疗行业的采用量分别增长 108x、41x、41x、26x 和 24x。
- a16z 称 AI 重度用户正在科技行业之外出现,Codex 是增长最快的企业级 Agent 产品之一。
- 数据来自其 “Charts of the Week”,主要追踪企业订阅与应用使用趋势。
- 该横截面与 Altman “宏观采用速度低于预期”的判断并不冲突:增量正从非研发岗位的重复性知识工作中产生。
🔗 a16z 推文 | Charts of the Week
8. [持续跟踪] Grok Build 向免费用户开放,新增 Extra High Effort 档位#
核心亮点: xAI 将 Grok Build 开放给 X 免费用户,并加入 /effort 最高推理档位供 Grok 4.6 处理困难项目。
- 前情提要: Grok 4.6 此前已登录 Vertex AI 并登顶 CursorBench;xAI 随后向少量企业开放 Grok Bot 现场部署。
- 最新进展: XFreeze 宣布免费用户可以直接在 Grok 内构建 App、网站、游戏和仪表盘;通过 /effort 可切换到 Extra High Effort。
- 马斯克转发了一段对比视频,称 Grok Bot 三个月后的流体力学模拟能力“amazing”。
🔗 XFreeze 推文 | 马斯克转发
9. DeepMind 提出 Recirc:给模型加“循环”,不重训也能显著提分#
核心亮点: DeepMind 论文 Recirc 在推理时向模型注入递归,Gemma3 系列困惑度下降 23%,GSM8k 准确率提升 21%,全程无需重训练。
- 前馈 transformer 有多少层就能更新多少次内部状态;Recirc 通过在 prefill 阶段把激活值重新送回模型,让模型像动力系统一样跟踪信念状态。
- 生成成本保持平稳,串行计算集中在 prefill;模型原始权重完全冻结,只需少量超参数调整。
- 论文采用自适应变体,在 Gemma3 家族上验证效果;作者认为这类“训练无关”架构演化可能启发出更鲁棒的递归自我改进方案。
10. [持续跟踪] 匿名模型 Ox Alpha 被扒出“智谱血缘”#
核心亮点: 量子位通过 tokenizer、视频编码与 API 报错特征推断,OpenRouter 上的匿名模型 Ox Alpha 与智谱 GLM 存在血缘关系。
- 前情提要: Ox Alpha 此前以匿名身份上线 OpenRouter,提供 1M 上下文与多模态能力;实测 DeepSWE 通过率 58.4%,社区对其地理来源的猜测一度指向美国东海岸后又反转。
- 最新进展: 量子位对比多项技术特征后认为其与智谱 GLM 相近;同时也有观点怀疑 Cursor 使用了开源 GLM 训练。
- 目前尚无官方确认,相关判断仍属技术推断。
🔗 量子位报道
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| Alishahryar1/free-claude-code | LLM 网关 / 开发工具 | 47.9k |
| NousResearch/hermes-agent | AI Agent | 234.9k |
| block/buzz | Agent 协作基础设施 | 30.1k |
1. Alishahryar1/free-claude-code ⭐ 今日 +1081#
语言/许可: Python / MIT
总 Stars: 47.9k
仓库: GitHub
项目定位:
面向编码 Agent 的统一模型访问网关,将 Claude Code、Codex、Pi、OpenCode 等 9 个编码代理接入 49 个免费/订阅/本地模型提供商,解决多提供商 Key 管理、模型选择与故障切换问题。
核心功能:
- 本地代理 + 管理 UI,集中配置 NVIDIA NIM、OpenRouter、Groq、SiliconFlow 等提供商的 Key 与模型映射
- 为各编码 Agent 提供独立启动器(
fcc-claude、fcc-codex等),保留原生会话、扩展与工具链能力 - 按序 Fallback:单轮对话内请求失败自动切换下一提供商,不中断任务
- 输出 token 优化:RTK 过滤常规命令输出,本地处理 quota 探测、命令前缀、标题与文件路径,减少无效模型调用
技术亮点:
本地代理完成多 Provider 协议统一与模型目录抽象,模型对 Agent 原生 /model 选择器透明,客户端零改动即可跨提供商切换。
2. NousResearch/hermes-agent ⭐ 今日 +454#
语言/许可: Python / MIT
总 Stars: 234.9k
仓库: GitHub
项目定位:
具备闭环学习能力的通用 AI Agent 框架,通过”经验→技能→记忆”机制实现跨会话自我改进,面向需要长期自主运行的 Agent 开发者。
核心功能:
- 自主技能创建与迭代:复杂任务完成后生成技能,使用中持续改进,兼容 agentskills.io 开放标准
- 多平台统一网关:Telegram、Discord、Slack、WhatsApp、Signal 与 CLI 同一进程接入,支持语音备忘录本地转写
- 7 种执行后端:本地、Docker、SSH、Singularity、Modal、Daytona、Vercel Sandbox,其中 Modal/Daytona 提供空闲休眠的无服务器持久化
- 子代理并行编排与 Python RPC 工具调用,将多步流水线折叠为低上下文消耗的单个步骤
技术亮点:
基于 FTS5 会话检索 + LLM 摘要构建跨会话记忆;支持批处理轨迹生成与压缩,可直接产出工具调用模型的训练数据。
3. block/buzz ⭐ 今日 +410#
语言/许可: Rust / Apache-2.0
总 Stars: 30.1k
仓库: GitHub
项目定位:
Block 开源的人机协作工作区:以 Nostr relay 事件日志为统一底座,让人类与 AI Agent 以同一身份模型和审计轨迹共同完成代码评审、CI 与发布流程。
核心功能:
- 事件溯源架构:消息、评审、审批、工作流步骤、Git 事件均为 Nostr 签名事件,天然形成可搜索审计日志
- Agent 作为频道成员而非机器人:独立密钥对、独立频道成员关系,权限按身份作用域控制
- YAML 工作流引擎:消息/表情/定时/webhook 触发,支持审批门控
buzz-cli面向 LLM 工具调用设计(JSON in/out),附带 Goose、Codex、Claude Code 的 ACP harness
技术亮点:
Rust 实现 relay 与桌面端(Tauri),单事件日志统一身份、搜索与审计;通过 NIP-34 将 Git 协作(patch、仓库公告、状态)纳入同一事件流。
🟧 Hacker News 热议#
Anthropic’s best AI model struggles to attract users as cheaper tools thrive#
118 pts · 104 comments · ft.com
📌 内容总结
- 背景/作者意图:FT 报道,正文位于付费墙后,本次抓取的
link_content不包含正文内容;仅能从标题确认报道方向:Anthropic 最强模型在用户获取上表现不佳,更便宜的工具正在占据优势。 - HN 关注点:
- 无足够原文信息,无法提炼更多具体事实、数据或设计取舍。
💬 讨论总结
- 未提供具体评论内容(
top_comments为空),无法提炼 HN 社区观点;该帖显示有 104 条评论。
My agent.md to improve LLM-assisted code quality#
119 pts · 62 comments · fabiensanglard.net
📌 内容总结
- 背景/作者意图:Fabien Sanglard 分享他用于约束 LLM 编码风格的
agent.md文件。他从 2025 年对 LLM 编码的负面体验(代码无法编译),到 2026 年 1 月发现 LLM 能写复杂数据结构和定位 obscure bug,但代码质量差;随后通过 agentic IDE 反复给“无限耐心的初级 CS 学生”式反馈,最后把这些重复意见固化进agent.md。 - HN 关注点:
agent.md是 coding harness 在会话开始时自动注入 prompt 的指令文件,作者给出了完整规则列表:短函数名(<30 字符)、避免魔法数字、早返回/减少缩进、用 enum 替代 boolean 参数、严格分层边界、commit message 7 条规则、修 bug 先写测试等。- 作者明确这不是“银弹”:LLM 仍会幻觉、必须人工 review,但审查重点从代码风格转移到架构与设计。
- 用“每功能开新 session + 显式 reload agent.md”缓解上下文稀释(Lost in the Middle 现象)。
💬 讨论总结
- 未提供具体评论内容(
top_comments为空),无法提炼 HN 社区观点;该帖显示有 62 条评论。
AI Chip Architectures#
12 pts · 0 comments · jepeake.com
📌 内容总结
- 背景/作者意图:以 Hennessy & Patterson 2018 年图灵讲座 “A New Golden Age for Computer Architecture” 为引子,综述当前 AI 芯片架构设计空间。作者认为理解一款 AI 芯片只需回答四个问题:数据存在哪、如何搬到计算单元、计算单元长什么样、芯片如何扩展到集群。
- HN 关注点:
- 核心问题是内存墙与算术强度差异:训练/prefill 是 GEMM(高算术强度),decode 是 GEMV(低算术强度,权重带宽受限);连续批处理、投机解码、多 token 预测用于把 GEMV 重新拉回 GEMM。
- NVIDIA 路线是“可编程大规模并行 + 持续演进的 Tensor Core/TMA/异步流水线”,护城河是 CUDA 生态与嵌入客户的工程师;TPU 路线是“专用矩阵乘法机 + XLA 静态调度”,无硬件调度器、无缓存、无线程/warp。
- Scale-up / scale-out 分界明显:NVL72 用无源铜缆做机柜级一致内存域,跨机柜改用光模块/CPO;TPU 用 ICI 3D torus 组成超大 pod。
💬 讨论总结
- HN 暂无评论。
Hugging Face 寻求 130 亿美元出售,英伟达洽谈投资 Perplexity
- Hugging Face 探索出售,估值至少 130 亿美元
- 英伟达洽谈投资 Perplexity,估值或超 300 亿美元
- 阿里 Wan3.0 上线,ChatGPT Search 机制突变
Hugging Face 探索出售,估值至少 130 亿美元;英伟达洽谈投资 Perplexity,估值或超 300 亿美元;阿里发布 Wan3.0 视频模型;ChatGPT Search 的 site: 查询占比激增 45 倍。
1️⃣ Hugging Face 寻求整体出售,估值至少 130 亿美元#
- 核心事实:据 Business Insider 报道,Hugging Face 已聘请投行摸底潜在买家收购意向,交易估值至少 130 亿美元,谈判仍处早期阶段,最终也可能不卖。
- 关键转折:2025 年底公司曾拒绝英伟达 5 亿美元投资(对应约 70 亿美元估值),CEO Clément Delangue 多次强调”中立性”是平台生命线;如今主动问价,姿态鲜明转变。
- 资产与风险:平台托管超 200 万个模型,是开源 AI 生态的默认分发入口。行业分析认为,其真正壁垒是开发者使用习惯与社区黏性;但若落入云厂商或芯片巨头之手,其他玩家是否还愿意在此发布模型将成为最大变量。
2️⃣ 英伟达洽谈投资 Perplexity,估值或超 300 亿美元#
- 交易动态:The Information 报道,英伟达正在洽谈投资 AI 搜索公司 Perplexity,本轮融资后估值有望突破 300 亿美元。
- 业务数据:Perplexity 年化收入已超过 7.5 亿美元,今年年初尚不足 2.5 亿;增长主要来自 AI 搜索订阅与电脑端 Agent 产品 Perplexity Computer。
- 生态意图:Perplexity 今年 3 月已加入英伟达牵头的 Nemotron Coalition。对英伟达而言,这是从 GPU 算力向模型生态、应用入口延伸的一环;对 Perplexity 而言,则是在 OpenAI、Google 挤压下获取算力与生态绑定的机会。
🔗 爱范儿报道
3️⃣ [持续跟踪] GPT-5.6 Sol 降价促销延续,Vercel 称其成增长最快前沿模型#
- 前情提要:OpenAI 此前将 GPT-5.6 Sol 的 API 价格下调约 20%(输入 5→4 美元/百万 token,输出 30→20 美元),促销至少持续至 11 月 21 日。
- 最新进展:Vercel CEO Guillermo Rauch 今日表示,Sol 在 Vercel AI Gateway 上已成为增长最快的前沿模型,并评论”智能正在变便宜”——推理成本下降时,用量增长明显,需求弹性很高。
- 行业意义:这为模型降价如何传导为实际调用量提供了最新数据点,也解释了网关/路由层近期升温的原因——价格波动正成为开发者必须管理的基础设施变量。
4️⃣ 阿里视频生成大模型 Wan3.0 正式上线#
- 核心发布:8 月 24 日,阿里巴巴视频生成大模型 Wan3.0 正式上线,行业评价”稳定、真实、有质感”。
- 行业影响:Wan 系列此前已广泛应用于国内 AI 视频生成工具链,3.0 的发布将直接影响视频生成模型的竞争格局。
🔗 量子位报道
5️⃣ ChatGPT Search 底层机制突变:site: 查询占比 45 倍激增#
- 数据变化:Promptwatch 监测显示,8 月 8 日后 ChatGPT Search 的 site: 定向查询占比从日均 0.368% 升至 16.78%,放大近 45.5 倍。
- 机制推测:ChatGPT Search 新流程可能改为”先全网发现候选来源,再锁定特定域名寻找文档、规则和更新”,对特定站点做定点搜刮。
- GEO 影响:网站获得 AI 引用的竞争变成两层——域名先入选,页面再争取引用。可抓取、可核验的一手内容体系成为基础门槛。
6️⃣ 小米发布玄戒芯片与 AI 本地主机,支持 120B 双模型#
- 沟通会:小米今日 14 点以图文直播举行玄戒芯片技术沟通会,负责人朱丹介绍最新进展,距首款旗舰处理器亮相已 459 天。
- 硬件发布:会上公布 AI 本地主机,搭载自研 O3、O100、D100 三颗芯片,支持 120B 与 3B 双模型运行,可切换快慢系统。
- 背景:玄戒 O1 已在三款终端累计出货超 100 万颗,新芯片将战场从手机延伸到本地 AI 推理场景。
7️⃣ Claude Code Remote Control 新增服务器模式,手机可发起本地会话#
- 功能更新:Anthropic 为 Claude Code Remote Control 加入服务器模式——开发者在电脑上运行
claude remote-control后,即可从 Claude 手机 App 或网页端发起新的本地会话。 - 关键设计:会话仍在用户自己的电脑上执行,本地文件、MCP、工具与项目配置不迁移云端;默认最多承载 32 条并发会话,可选择共享目录或为每条任务创建独立 Git worktree。
- 可用性:目前处于研究预览阶段,支持 Pro、Max、Team 与 Enterprise 计划;Team/Enterprise 管理员需先启用,不支持 API Key 登录。
🔗 爱范儿早报
8️⃣ Netflix 公开 LLM Judge 生产级生命周期:四阶段 + A/B 验证#
- 论文内容:Netflix 详述其 LLM 评判器在生产中的完整生命周期——Birth(多标准评估 + 人工标注基准)、Training(基于推理的 rubric 对齐调优)、Deployment(同一评判器兼作质量门禁与反思式生成)、Monitoring(人在回路漂移检测与重训)。
- 规模数据:该体系每周处理数十万条剧集级推荐解释,覆盖移动端数百万会员。
- 验证结果:五周 A/B 测试显示,对照无解释组,推荐解释将观看行为导向此前未看内容,并提升浏览到播放的成功转化,且无质量相关投诉。
9️⃣ 阿里达摩院发布肝癌诊断 AI 模型 DAMO LiON#
- 核心发布:达摩院联合中国医科大学附属盛京医院等机构研发的肝癌诊断 AI 模型 DAMO LiON 正式公布,可精准识别 1 厘米微小肿瘤。
- 落地价值:这是影像 AI 在肿瘤早筛方向的明确进展,有助于肝癌早期发现与诊疗路径优化。
🔗 量子位报道
🔟 [持续跟踪] 英伟达 AI 服务器明年涨价超 15%#
- 前情提要:内存成本持续上涨,英伟达此前已向大客户预警 AI 服务器将提价。
- 最新进展:彭博社报道,搭载英伟达 AI 芯片的服务器将在很多配置上提价超 15%,从 2027 年初出货系统生效,覆盖 Vera Rubin 与 Grace Blackwell 平台,具体涨幅取决于芯片代际与内存配置。
- 传导路径:涨价将沿芯片 → 服务器 → 云厂商 → 开发者链条继续传导。
🔗 爱范儿早报