Yeekal Logo Yeekal
4,814 字
早报 | MORNING 2026-08-03

TPU 8t/8i 发布,DeepMind 权重即模态,B200 现货零供给

今日要点
  • Google 发布 TPU 8t/8i,训练推理首次分体
  • DeepMind 提出权重即模态,推理时组合技能
  • B200 现货零供给,13 家云厂商无节点可租
Google 发布第八代 TPU 8t/8i,首次将训练与推理芯片分体设计,低延迟推理场景性价比最高提升 80%;DeepMind 提出权重即模态新研究,技能组合在推理时完成;B200 现货市场零供给,时价向 6.5-7 美元/卡小时移动。

1️⃣ Google 发布第八代 TPU:训练与推理首次分体#

  • 核心发布:Google Cloud 推出第八代 TPU 系统,首次将训练芯片 TPU 8t 与推理芯片 TPU 8i 分开设计。
  • 规格与收益:TPU 8t 面向万亿参数预训练,单组 9600 颗芯片、121 exaflops 算力、2PB 共享内存,峰值性能为上代 3 倍;TPU 8i 面向后训练与实时推理,通信密集型任务延迟最高降低一半,官方称低延迟场景性价比提升最高 80%,可扩展至 100 万+ 芯片。
  • 行业观察:训练与推理需求已经分道扬镳;Agent 任务的多轮交互让推理延迟成为新的定价锚点。 🔗 Google Cloud 公告 | 中文解读

2️⃣ Google DeepMind 提出 SkillSmith:模型权重变成新模态#

  • 核心亮点:DeepMind 新研究直接将“模型权重”作为 LLM 可读的另一种模态,让技能组合在推理时完成,而非训练时。
  • 实现方式:增强模型读取已有 prefix weights 和描述目标能力的文本,直接输出体现该能力的新 prefix weights;团队称之为 instruction-steered parametric synthesis。
  • 效果与意义:实验增益超过单独文本适配与单独权重适配;若成立,技能定制有望从“跑一次训练”变为“一次前向推理”。 🔗 论文 | elvis 解读

3️⃣ B200 现货市场罕见真空:13 家云厂商零供给#

  • 核心亮点:开发者 Suhail 称在自己等待 B200 订单交付期间,问遍 13 家云服务商,连 1 个节点的 B200/B200s 现货都找不到。
  • 价格信号:现货 GPU 时价正朝 6.5–7 美元/卡小时移动,他据此判断推理成本会继续上升。
  • 行业观察:这轮缺货发生在“推理需求”而非“训练需求”一侧;当现货市场同时抢卡,Agent 应用的边际成本将首先承压。 🔗 Suhail 推文

4️⃣ 美国商务部拟投 8.74 亿美元入股七家半导体企业#

  • 核心事件:美国商务部与 GlobalFoundries、Kepler Computing、Multibeam、Extropic、Thintronics、OBSIDIA、Aeluma 签署非约束性意向书,拟提供最高 8.74 亿美元研发资金,并在最终协议中取得少数非控股股权。
  • 覆盖方向:分别落在 CPO/硅光先进封装、铁电 3D 集成存储、电子束直写封装、概率计算芯片、低损耗介电材料、化合物半导体异质集成、芯片供应链身份核验。
  • 趋势判断:过去 14 个月美国政府股权或准股权安排累计约 37 笔;资金正从成熟制造项目转向商业化尚未验证的早期技术,以股权方式承担长周期研发风险。 🔗 有新Newin 盘点

5️⃣ Cloudflare 开启 Agents Week:把云重新定义为“为 Agent 而生”#

  • 核心发布:Cloudflare 博客宣布本周为 Agents Week,并抛出一个反向问题:不是“Agent Cloud 应该是什么”,而是“你的 agent 需要什么样的 Agent Cloud”。
  • 内容框架:未来五天将覆盖 agent 原语与执行层、agentic 软件开发生命周期、组织内安全访问、agentic web,以及 agent 与人类的现实共存。
  • 行业观察:把设计对象从“盯着屏幕的人”换成“没有疲劳的 agent”,意味着存储、计算、支付与发现机制都需要重新定义;现有 web 在短期内仍需一层翻译层。 🔗 Cloudflare 官方博客

6️⃣ Vercel CEO 披露内部 Agent @v:已介入公司全部日常岗位#

  • 核心表态:Vercel CEO Guillermo Rauch 称,公司内部运营 Agent @v 已覆盖 finance、comms、docs、marketing、engineering、business analytics,日交互量与 token 消耗呈指数增长。
  • 工作机制:@v 由团队预置技能并持续更新,按用户维护个性化记忆、工作流与日程;它已用于提醒 skills.sh 达到 100 万技能这类周期性事件。
  • 行业意义:Rauch 同时强调“这是我们的 agent,不是 BigAI 的 agent”——控制权从 source 到 runtime 到 data 到 token,正在成为企业采用 agent 时的核心命题。 🔗 Guillermo Rauch 推文

7️⃣ Firecrawl 开源 pdf-inspector:20 毫秒让 PDF 变成 Markdown#

  • 核心发布:Firecrawl 开源 Rust 编写的 PDF 解析工具 pdf-inspector,约 20 毫秒分类任意 PDF,并在本地提取干净 Markdown。
  • 性能:200 个 PDF 约 2.8 秒完成;表格和图表提取质量尤其突出,无需等待 OCR 或复杂解析链路。
  • 行业观察:Agent 规模化处理文档时,低延迟、本地化、结构化提取正在变成基础设施能力;PDF 从“麻烦输入”变成可即时消费的数据。 🔗 Berryxia 介绍

8️⃣ [持续跟踪] OpenAI Astra 数学成果争议升级:Gary Marcus 发布八大误解清单#

  • 前情提要:OpenAI 前日公布内部模型 Astra 解决 10 项数学/理论计算机问题,社区围绕验证方式与“数学是否已解决”展开争论。
  • 最新进展:Gary Marcus 今日发布长文列出八条“误解”,核心是:数学可依赖符号验证和廉价合成数据,因此是特例,不能保证跨领域通用;Astra 的公布更像营销而非科学;生成式模型在开放式问题上的能力仍存疑。他还表示,过去 24 小时的批评者没有回应这一核心论点。
  • 社区分化:辩论从“Astra 是否厉害”滑向“AI 是否接近通用智能”;Marcus 认为单点突破被过度外推,与 IBM Watson 从 Jeopardy 到癌症治疗的失败类似。 🔗 Gary Marcus 八大误解 | 后续回应

9️⃣ MIT 与哈佛新论文:LLM 离真实科学发现还很远#

  • 核心发现:MIT 和哈佛研究人员发布论文《Evaluating Large Language Models in Scientific Discovery》,提出 SDE 评测框架,考察模型在开放式研究循环中的表现。
  • 结果:前沿模型在生物学、化学、材料、物理中“提出可检验假设—设计实验—解读模糊结果”的迭代过程里迅速失效;扩大模型规模与算力无法弥合差距,不同厂商的顶级模型存在相同盲点。
  • 行业观察:论文把“记住教科书”和“做科学”分开——静态 benchmark 高分不能等价于自主发现能力。 🔗 Gary Marcus 转述 | How To Prompt 解读

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
lyogavin/airllm推理/模型25.6k
Panniantong/Agent-ReachAI Agent64.7k
antirez/ds4推理/模型20.0k

1. lyogavin/airllm ⭐ 今日 +819#

语言/许可: Python / Apache-2.0
总 Stars: 25.6k
仓库: GitHub

项目定位:
面向低显存场景的 LLM 推理库,解决 70B 稠密模型与数百 B/数千 B 级 MoE 模型在单张消费级 GPU 上的本地运行问题。目标用户是本地推理、私有化部署和边缘侧模型开发者。

核心功能:

  • 通过按层分片加载/卸载,让 70B 稠密模型在 4GB GPU 上运行,不依赖量化、蒸馏或剪枝。
  • 针对 MoE 模型按 token 路由流式加载被激活的 expert,可运行 DeepSeek-V3(671B)约需 12GB、Kimi K3(2.8T)约需 4GB。
  • 提供 4bit/8bit 块状量化压缩模式,降低磁盘加载开销,实测可带来最高约 3 倍推理加速。
  • 通过 AutoModel 统一接口兼容 Llama、Qwen、DeepSeek、ChatGLM、Mistral 等主流模型,并支持 MacOS 与 CPU 推理。

技术亮点:
层式分片 + per-expert 流式加载,将显存瓶颈转化为磁盘吞吐问题;结合 prefetching 将模型加载与计算重叠,量化只作用于权重,避免激活值量化带来的精度损失。


2. Panniantong/Agent-Reach ⭐ 今日 +659#

语言/许可: Python / MIT
总 Stars: 64.7k
仓库: GitHub

项目定位:
面向 AI Agent 的互联网访问能力层,以 CLI/MCP 方式让 Claude Code、Cursor、OpenClaw 等 Agent 读取 Twitter、Reddit、YouTube、B站、小红书等多平台内容,规避各平台 API 付费、封禁和登录墙问题。目标用户是 Agent 开发者和高频使用终端 Agent 的工程师。

核心功能:

  • 每个平台按“首选 + 备选”有序后端路由,例如 twitter-cli ▸ OpenCLI ▸ bird、bili-cli ▸ OpenCLI;后端失效时自动切换,无需改代码。
  • agent-reach doctor 一条命令检测各渠道真实可用性,并输出当前后端与修复建议;安装和更新可由 Agent 自主读取文档完成。
  • 零配置渠道覆盖任意网页、YouTube 字幕、RSS、GitHub、B站、V2EX;需要登录态的平台按需通过 OpenCLI/Cookie 本地解锁。
  • 兼容支持 shell 执行的 Agent 生态,并通过 SKILL.md 注册能力;接入 Exa 语义搜索作为免费搜索后端。

技术亮点:
实现上不是抓取工具的包装层,而是“选型 + 安装 + 诊断 + 路由”的能力层:实际读取由 Agent 直接调用上游 CLI/MCP 完成,channel 抽象加有序后端列表提供容错,本地配置以 0600 权限存储,并支持 --safe / --dry-run 安装。


3. antirez/ds4 ⭐ 今日 +139#

语言/许可: C / MIT
总 Stars: 20.0k
仓库: GitHub

项目定位:
面向 DeepSeek V4 Flash/PRO 的专用本地推理引擎 DwarfStar,针对 Metal、CUDA、ROCm 后端做模型、量化与调度的协同优化。解决高内存个人设备、存量 CUDA 服务器和 AMD 平台上运行最新开源大模型的部署问题。目标用户是 AI Infra、私有化推理和本地 Agent 开发者。

核心功能:

  • 支持 DeepSeek V4 Flash/PRO 与 GLM 5.2 的专用 GGUF,提供 96/128GB、256GB、512GB 内存档位的量化方案;非通用 GGUF runner。
  • 提供 ds4-server,通过 decode/generation 微批处理,可在 8x L40S 等存量 Ada 架构 GPU 上搭建多用户服务,实现约 120 t/s 聚合生成、2000 t/s prefill。
  • 支持 SSD streaming 应对内存不足;支持双 Mac RDMA tensor parallelism,以及 pipeline parallelism 跨机聚合内存。
  • 集成 DSpark 投机解码与 GLM MTP 实验路径,并附带 GGUF 生成、imatrix、质量对比和官方 continuation 回归测试工具链。

技术亮点:
对 routed MoE 做非对称量化:仅量化路由专家部分,up/gate 用 IQ2_XXS、down 用 Q2_K,非专家参数保留精度,使 2bit 量化下仍能稳定支持 agent 工具调用;推理引擎与模型格式、HTTP server、KV cache、coding agent 作为整体构建测试,而非通用运行时。

🟧 Hacker News 热议#

Karpathy’s Pelican#

402 pts · 315 comments · twitter.com/karpathy

📌 内容总结

  • Karpathy 认为”画一只骑自行车的鹈鹕”这类 SVG 测试已经饱和,提出更泛化的基准:给 Opus 5《魔戒》第一章第一段 + 1M token 预算(约 $10),要求生成 three.js 渲染。
  • 模型耗时约 2 小时,产出 5500 行代码,程序化生成场景动画;效果”janky but fun”。
  • 核心论点:这类高度定制内容过去”没人会花时间写”,现在因为成本趋近于零而变得可行;他设想”按需生成的临时 GTA 世界”。
  • 自曝局限:LLM 无法原生感知视频或游玩游戏,只能靠截图缓慢自审,导致多次出错——多模态/游戏内感知仍是明显短板。

💬 讨论总结

  • 基准之争:多数人认可 pelican 已饱和,新基准应”让模型先表现糟糕”才有进步空间;但也有人反驳,pelican 的优势恰恰是成本低、一眼可评判,长视频既费 token 又难横向比较。
  • 对 Karpathy 身份的质疑:有评论指其作为 Anthropic 员工在”为 IPO 推销营销内容”,并翻出 8 个月前”可靠 agent 至少十年”的言论;回复者反驳称 8 个月内 agent 能力可能确实大幅提升,且原帖只是在指出一个开放问题(视频输入能力缺失),不是营销。
  • 游戏从业者视角:前游戏开发者称”非游戏从业者谈游戏很可笑”,AI slop 游戏零留存,“15 分钟以上游玩人数”才是有效指标;“hyper custom worlds” 显示对玩家需求的无知。附和者将之类比”区块链游戏”。
  • Three.js 过拟合怀疑被反驳:有人认为 Anthropic 只是专门训练了 three.js 能力,不具一般性;高赞反驳指出,从一段抽象文学文本到 3D 动画需要海量隐式空间/物理/常识知识。另有评论者实测用 Opus 5 从 three.js 迁移到 ogl.js,加载时间从数秒降至 0.5s,对 WebGL 理解印象深刻。
  • 一次性软件(throwaway software)类比:有评论用廉价塑料类比”一次性软件”;经济学反驳认为软件无单位复制成本,一次性方案难以与耐用软件竞争,但”一次性任务”场景确实价值巨大。
  • 成本与版权现实:有人指出普通用户会被版权拒绝,而 Karpathy 是内部员工、免费用且不烧自己的 token;“约等于免费”实际是投资人的钱。
  • 质量批评与辩护并存:动画建模松散、比尔博”消失”被过度直译;但也有评论认为”烂”正是关键——这测的是物理世界理解,而不是精美度。

🔗 原文 · HN 讨论页

Autoregressive Language Model on the 6502 Processor#

31 pts · 5 comments · mattbeton.com

📌 内容总结

  • 作者目标:在 1975 年的 MOS 6502(BBC Micro,32KB RAM)上跑一个自回归语言模型——这是从 1975 年视角看”最强能装下的模型”。
  • 技术方案:BitNet 三值量化(1.58 bit/参数),4 参数/字节以规避 6502 上昂贵的除法解包;选 Mamba 而非 GRU,因 GRU 谱半径在 BitNet 下爆炸、训练全部发散;16-bit 累加器 + 可学习右移缩放(shr)解决动态范围坍缩;softmax 用查表近似。
  • 实际结果:9KB 推理代码 + 13KB 权重 = 52K 参数,能生成语法基本通顺的英文短句;随机种子固定,输出每次相同;可在 jsbeeb 浏览器模拟器中直接运行。
  • 作者将其归入”hardware lottery”论点:架构选择应随硬件约束而变。

💬 讨论总结

  • 共识:这是一个很酷的项目;cc65 编译 6502 并非最优,手写汇编能进一步压空间/提性能。
  • 有评论从 NES 编程经验出发,惊讶作者没用汇编;另有人联想”如果 1975 年的人看到这个 demo 会作何反应”。
  • 有人希望这类研究最终推动真正小型化的边缘 AI(如眼镜内 LLM)。

🔗 原文 · HN 讨论页

My personal AI benchmark: “Generate an SVG of a frog with a Habsburg jaw.”#

83 pts · 42 comments · vaguespac.es

📌 内容总结

  • 作者(Jay Mollica)建立了一个持续基准:统一 prompt “生成一只带哈布斯堡下颌的青蛙 SVG”,每月对 14 个模型各跑 3 次;2026 年 8 月共 42 次运行,全部产出 SVG。
  • 所有模型都理解”突出的下巴/反颌”,但诠释差异巨大:Claude Opus 5 用精确贝塞尔曲线构造”巨大前突下颌”并加解剖注释,视觉质量明显最高;Gemini 3.6 Flash 画成王室肖像风格;部分模型主动加了皇冠、“皇室腮红”等提示中不存在的内容。
  • 实际结论:这是一个低成本、可重复、能区分”按指令执行”与”自由发挥”的基准;模型会在 SVG 注释中暴露其”自我叙事”倾向。

💬 讨论总结

  • 基准有效性获认可:7/14 个模型把”哈布斯堡(王室姓氏)“误读为”王室主题”,擅自加入王冠等元素;Mistral 多次调用返回字节级相同输出;Gemini 在代码里写 65 条注释自我叙述,Llama 完全沉默——“是否按指令行事”和”是否确定性输出”是直接可用的工程判断。
  • 质量评价:公认 Opus 5 最接近人类美术;多数失败案例能画好青蛙脸,但下颌只是个”大块头”,与面部结构缺乏解剖学整合。
  • 几何盲点观察:所有模型都选择正面构图;但下颌特征侧面最明显。评论者认为这暴露了模型缺乏”从哪个角度最能表达特征”的几何推理。
  • 基准意义争论:有人质疑此类测试的实用价值;反驳称它测的是”生成训练集之外内容的能力”。另一方认为这是意识形态化的 AGI 追求,专用生成模型可以更便宜更好地完成同样任务。
  • 模型覆盖缺口:多位用户要求加入 DeepSeek V4 Flash、Qwen 3.8、GLM 5.2、GPT-5.6 Sol、Fable;作者回应下月加入。

🔗 原文 · HN 讨论页

今日洞察#

TPU 8t/8i 的训练与推理分体,与 B200 现货零供给指向同一件事:推理正在成为算力市场的定价锚。Google 将 8i 定位为低延迟场景性价比提升最高 80%;开发者 Suhail 问遍 13 家云厂商找不到 B200 现货节点,时价正朝 6.5-7 美元/卡小时移动。缺货集中于推理需求一侧,Agent 应用的多轮交互成本将最先承压。

DeepMind SkillSmith 把模型定制变成一个推理任务。模型读取已有 prefix weights 和文本描述,直接输出具备新能力的权重,技能组合在推理时完成。若成立,小团队获得专用模型的成本将等同于一次前向推理,基座模型厂商的竞争重心也会落到推理分发能力上。

开发者侧信号同样明确。airllm 今日新增 819 stars,antirez 为 DeepSeek V4 写了专用引擎 ds4,低显存推理已经越过可用性门槛。ds4 明确不做通用 GGUF runner,将模型格式、HTTP server、KV cache 与 coding agent 整体调优。显存约束被转化为磁盘吞吐与模型专用优化后,通用推理运行时的假设在松动,本地 Agent 工作负载会加速离开云端 API。

1,639 字
晚报 | EVENING 2026-08-03

Qwen3.8-Max 发布,MiniMax H3 权重开源,Astra 被指无对照组

今日要点
  • 阿里发布 Qwen3.8-Max,2.4T 参数下周开源
  • MiniMax H3 权重公开,ComfyUI 等 Day 0 支持
  • OpenAI Astra 被指无对照组,Fable 可解半数题
阿里发布 2.4T 参数 Qwen3.8-Max,下周开源权重;MiniMax H3 权重在 Hugging Face 公开;Gary Marcus 称 Astra 半数数学题可由 Fable 解决且无对照组;DeepSeek V4 Flash 单日消耗 8 万亿 Token;贾扬清公布 Intent Lab 与 Fleet。

1️⃣ 阿里正式发布 Qwen3.8-Max:2.4T 参数,下周开源权重#

  • 核心发布:阿里发布 Qwen3.8-Max,总参数 2.4T、激活参数 95B,API 定价输入 2/Mtoken、输出2/M token、输出 6/M token。
  • 能力清单:官方称其支持 10 天以上自主编程、500+ 轮芯片设计优化、365 天模拟电商经营,并具备“边做边看边纠错”的视觉反馈闭环。
  • 开源计划:下周同时放出 Qwen3.8-Max 与 Qwen3.8-27B 权重,为 Max 系列首次开源。
  • 榜单表现:发布日进入 Text Arena 第 2、Vision Arena 第 2(1305 分,落后 Claude Fable 5 仅 13 分)、Frontend Code Arena 第 4(1668 分,与 Claude Opus 5 High 持平)。 🔗 Qwen 官方公告 | Arena 前端榜单 | Arena 视觉榜单 | 量子位

2️⃣ [持续跟踪] MiniMax H3 权重正式公开,Day 0 生态齐备#

  • 前情提要:MiniMax 上周发布统一多模态生成模型 H3,预告开放权重。
  • 最新突破:今日权重在 Hugging Face 公开;ComfyUI、vLLM-Omni、SGLang Diffusion、fal 同步提供 Day 0 支持。
  • 本地能力:SGLang 版称 2×RTX 5090 或 1×RTX 6000 可本地运行,成本约为 Seedance 2.0 的 1/3。
  • 模型特点:文本、图像、视频、音频可作为同一上下文输入,输出 5-15 秒 2K/24fps 视频并带原生立体声;社区称其为“首个达到 Seedance 级质量且开放权重”的视频模型。 🔗 Hugging Face | ComfyUI Day 0 | vLLM-Omni | SGLang

3️⃣ [持续跟踪] OpenAI Astra 被指无对照组,Fable 可解半数问题#

  • 前情提要:OpenAI 上周披露下一代模型 Astra 的内部版本解决 10 项数学与理论计算机问题,并附 Lean 4 形式化证明。
  • 最新进展:Gary Marcus 今日称其中一半问题可由 Anthropic 的 Fable 解决,OpenAI 未设置对照组;Elliot Glazer 也认为 Astra 并非超越 Sol 的阶跃变化,10 项突破是协作式启发的结果、部分 Sol 可达成。
  • 后续论据:Marcus 进一步指出,OpenAI 未将 Astra 命名为 GPT-6,暗示其自身亦清楚局限。
  • 延伸讨论:Nathan Witkin 发布长文称,人类验证能力将成为 AI 数学产出的瓶颈,前沿结果愈发难以独立核验。 🔗 Marcus 推文 | Glazer 观点 | Marcus 后续 | Witkin 长文

4️⃣ DeepSeek V4 Flash 单日消耗 8 万亿 Token:Agent 用量成为新计价单位#

  • 核心数据:DeepSeek V4 Flash 在一个 AI 编程工具 OpenCode 中单日消耗 8 万亿 Token,其中 5 万亿来自免费额度、3 万亿来自付费套餐;OpenRouter 全平台日均约 6.6 万亿。
  • 价格对比:每百万输出 token 官方定价 2 元,约为 Claude Opus 4.8(170 元)的 1/85;Artificial Analysis 跑完同一套评测,V4 Flash 花费约 72 美元,Opus 4.8 为 3752 美元。
  • 行业意义:Agent 长任务让单任务 Token 消耗量级跃升,模型选型从“单次回答有多聪明”转向“完成一项任务要花多少钱、失败几次”。 🔗 爱范儿深度

5️⃣ 贾扬清创办 Intent Lab,发布自主 AI 团队 Fleet#

  • 核心发布:离开英伟达一个月后,贾扬清新公司 Intent Lab 亮相,产品 Fleet 定位为“把意图打造成生产级系统”的自主 AI 团队。
  • 三个早期成果:AI 将 GLM-5.2 在 TensorRT-LLM 上的端到端推理性能提升 534%;从零构建 SQLite 兼容数据库并通过 600 万项验收测试,成本约 350 美元;AgentFS 分布式文件系统经形式化验证,部分性能达 EFS 的 626 倍。
  • 业务流程:覆盖理解、设计、协调、构建、验证、演进六个环节,由 AI 完成从架构到部署的全流程。 🔗 创业邦报道

6️⃣ CuspAI 完成 4.5 亿美元 B 轮,贝索斯基金跟投#

  • 核心事件:英国 AI 材料科学公司 CuspAI 完成 4.5 亿美元 B 轮融资,估值 26 亿美元,Kleiner Perkins 与 NEA 联合领投,贝索斯旗下个人投资机构跟投。
  • 技术路线:用生成式 AI 与分子模拟在数小时内完成数百万晶体结构生成与筛选,瞄准半导体衬底与高密度储能材料。
  • 资金用途:扩建超算集群,并与半导体巨头推进下一代芯片材料的商业化验证。 🔗 爱范儿早报

7️⃣ Simile 完成 2 亿美元 B 轮,AI 模拟用户赛道估值翻倍#

  • 核心事件:斯坦福小镇作者 Joon Sung Park 创立的 Simile 完成 2 亿美元 B 轮,估值 20 亿美元;5 个月前其刚完成 1 亿美元 A 轮。
  • 投资方:Greenoaks 领投,Index、Bain Capital Ventures、CVS Health Ventures 等参投。
  • 产品定位:面向营销与产品研究生成模拟用户;CVS 既是投资方也是重要客户。
  • 赛道信号:同类公司 Aaru 去年底以 10 亿美元估值完成 A 轮,合成用户研究正在进入主流风投视野。 🔗 Z Potentials 编译 | TechCrunch 原文

8️⃣ Arena 推出 AutoEval:奖励模型提前给出榜单预估分#

  • 核心更新:大模型评测平台 Arena 上线 AutoEval,用数百万真实用户偏好训练的奖励模型,在新模型尚未积累足够真人投票时先生成预估排名。
  • 回测表现:2026 年 5-6 月回测拟合线为 y=0.96x+55.49,多数模型误差区间贴近真人评分基准线。
  • 定位:AutoEval 结果单独标注,后续由实时真人投票形成的正式分数校正,不替代排行榜。 🔗 爱范儿早报

9️⃣ Anthropic 内部 90% 代码由 Claude Code 编写,团队按五种角色重组#

  • 核心数据:Anthropic 工程师 Boris Cherny 称公司平均 90% 的代码由 Claude Code 生成,他本人自去年 11 月起 100% 使用。
  • 角色重构:前端、后端、产品设计的分工被认为过时,实际团队分化为原型师、构建者、维护者、扩展者、收尾人五种角色,其中扩展者最为抢手。
  • 行业意义:这是头部 AI 实验室首次公开内部 AI 代码采用率,成为 Agentic Coding 落地程度的关键参照。 🔗 小互转述