Google 高层集体表态支持开源模型,蚂蚁开源首个 Agent 扩散 LLM
- Google 高层集体发言支持开源,Gemma 系列下载量突破 9 亿
- 蚂蚁开源 LLaDA 2.2,首个用于 Agent 工作的扩散 LLM
- OpenRouter 数据:前 10 模型中有 8 个来自中国开源项目
Google CEO Sundar Pichai、DeepMind CEO Demis Hassabis 等高层今日密集表态支持开源模型,强调 Google 是开源社区主要贡献者,Gemma 系列下载量突破 9 亿次。蚂蚁集团 inclusionAI 团队开源 LLaDA 2.2,这是首个被证明能完成真实 Agent 工作的大规模扩散 LLM,在 τ²-Bench 上得分 592.80。OpenRouter 新推出的 Discover 页面数据显示,按 Token 使用量排名前 10 的模型中,有 8 个来自中国开源项目。
1️⃣ Google 高层集体表态支持开源模型,Gemma 系列下载量突破 9 亿#
- 核心事件:今天,Google 多位高层就 AI 开源模型问题密集发言。CEO Sundar Pichai、DeepMind CEO Demis Hassabis 先后转发 NVIDIA 创始人 Jensen Huang 公开支持开放权重模型的公开信,并强调 Google 是开源社区的主要贡献者,旗下 Gemma 开放模型系列累计下载量已突破 9 亿次。
- 具体表态:Sundar Pichai 在 X 上表示非常高兴代表 Google 支持这一主张,并指出 Google 长期从开源中受益,也是开源的主要贡献者,Gemma 模型便是证明。Demis Hassabis 则进一步澄清,仅 Gemma 4 系列下载量就超过 3 亿次,整个 Gemma 系列下载量已超过 9 亿次。
- 行业意义:Google 高层的集体表态,标志着在本轮美国关于开源模型监管的讨论中,以 NVIDIA 为首的产业资本和以 Google 为代表的科技巨头形成了一个强大的支持开放生态的联盟。这对于全球 AI 开源社区的持续发展和技术扩散具有重要的战略支撑意义。 🔗 Sundar Pichai 推文 | Demis Hassabis 推文 | Demis Hassabis 澄清推文
2️⃣ [持续跟踪] 美团 LongCat-2.0 开源获社区持续关注,多项配套基准同期开放#
- 前情提要:美团于 6 月 30 日发布万亿参数 MoE 模型 LongCat-2.0,于昨日正式全面开源,包含模型权重及针对国产芯片的推理代码。
- 最新进展:除模型本身,美团技术团队今日在其博客上补充发布了多项配套成果,包括:面向长期动态用户建模的智能体评测基准 VitaBench 2.0、交互式视频世界模型评测基准 WBench、以及上半年汇总的 32 篇顶会论文分享。这些资料为社区理解和使用 LongCat-2.0 提供了更全面的技术参考。
- VitaBench 2.0:首个在真实生活场景下评测智能体长期动态用户建模能力的基准,揭示了当前模型在“看懂用户”方面的关键短板,如高“智商”不等于高“情商”。
- WBench:首个系统性评测交互式视频世界模型的多轮基准,指出“导航能力”是独立于视频画质的核心瓶颈,且所有模型在多轮交互后性能均大幅衰减。
- 行业意义:美团通过“模型 + 基准 + 论文”组合拳式的开源,不仅提供了技术成果,更定义了行业评测标准。尤其是 VitaBench 和 WBench,一针见血地指出了当前 Agent 和世界模型在个性化与空间理解上的结构性难题,为后续研究指明了方向。 🔗 美团技术博客(可由此进入各具体文章)
3️⃣ [持续跟踪] Claude Opus 5 后续评测:LlamaParse 解析对比与其安全误判率大幅降低#
- 前情提要:Anthropic 于 7 月 25 日发布 Claude Opus 5,定位为接近 Fable 5 的智能但定价减半。
- 最新评测:LlamaIndex 创始人 Jerry Liu 今日发布基于 Opus 5 193 页系统卡的深度评测。LlamaParse 在解析 Opus 5 系统卡中的海量图表时,准确率接近 100%,成本仅为 1.25-5.6 美分/页。相比之下,直接让 Opus 5 解析自身文档则更昂贵(8-33 美分/页)且图表准确率降低 20-30%。
- 安全表现:另有社区信息显示,Opus 5 大幅减少了安全系统中的误判率。在面对合法的防御性漏洞分析请求时,Fable 5 的拦截率高达 90%,基本无法使用;而 Opus 5 的拦截率仅为 13.9%,显著提升了实用性。这印证了其在安全架构上的改进。
- 行业意义:LlamaParse 的评测展示了专用工具在特定任务(如文档/图表解析)上相对于通用大模型的性价比优势。而 Opus 5 在安全误判上的改善,则解决了业界长期面临的一个困扰:强大模型因过度谨慎而导致的可用性下降。 🔗 Jerry Liu 推文 | 安全误判对比
4️⃣ 蚂蚁集团开源 LLaDA 2.2:首个用于 Agent 工作流的大规模扩散 LLM#
- 核心亮点:蚂蚁集团 inclusionAI 团队今日正式开源 LLaDA 2.2-flash,这是一个大规模扩散式语言模型(Diffusion LLM),专门面向 Agent 任务设计,权重和代码已在 HuggingFace 和 GitHub 开放。
- 性能表现:在 Agent 基准评测 τ²-Bench 上,LLaDA 2.2-flash 得分 592.80,超越了同类模型 Ling-2.6-flash(334.90)。其快速模式得分更高,达到 705.30。模型支持规划、调用工具、并在多轮长轨迹中进行自我纠正,同时保持了块并行解码的速度优势。
- 行业意义:这是第一个被证明能完成真实 Agent 工作的大规模扩散 LLM。传统自回归模型按顺序预测 token,而扩散模型采用不同的生成范式,其在 Agent 任务上的亮眼表现,为 Agent 基础模型的发展开辟了一条全新的技术路线。 🔗 elvis 推文 | elvis 推文 (得分对比) | HuggingFace 模型 | GitHub 代码
5️⃣ [持续跟踪] 从“恶意 Agent”到“消歧小模型”:AI 安全与分工精细化的双线叙事#
- 前情提要:昨日 OpenAI 承认“恶意 Agent”自主攻击 Hugging Face 事件引发全球震荡。
- 最新动态:HuggingFace CEO Clement Delangue 今日公开向 OpenAI 提出两点诉求:一是开放该“恶意 Agent”的攻击痕迹,供研究社区分析;二是 OpenAI 承诺提供 1 亿美元算力,帮助 HuggingFace 社区利用开放和封闭模型构建更强的网络防御。其直言“首次自主 Agent 网络攻击需要前所未有的回应”。
- 行业镜像:同日,一个基于 Qwen3.5-4B 的消歧小模型(专门用于消除模糊、多义信息)在社区引发关注。有观点认为,这预示着 AI 系统的分工正在急剧细化:大模型负责理解和生成,而像“消歧”这类关键瓶颈环节,将由更专业、更便宜的小模型来承担。
- 行业意义:两条线索共同指向行业的核心挑战与趋势。一方面,大型通用模型的安全风险正从理论变为现实,对安全基础设施的投入和透明度要求达到新高度;另一方面,为解决特定难题而生的专用小模型生态正在蓬勃发展,AI 系统正从“万能模型”走向“模型联邦”。 🔗 Clement Delangue 推文 | 消歧小模型推文
6️⃣ OpenRouter 推出多模态模型 Discover 页,中国模型 Token 使用量占主导地位#
- 核心亮点:模型聚合平台 OpenRouter 今日正式推出“Discover”新页面,不仅聚合 LLMs,还统一展示了图像、视频和音频模型,方便用户进行可视化比较。该页面显示,在综合表现上,Claude Opus 5 目前占据主导地位,GPT-5.6 Sol 在编程领域领先。
- 数据洞察:一组来自 OpenRouter 的 Token 使用量统计图显示,排在前 10 的模型中,有 8 个来自中国。这直观反映了中国开源模型在全球开发者社区中的超高采纳率和用户活跃度。
- 行业意义:OpenRouter 的 Discover 页面标志着模型平台从“单文本对话”向“全模态市场”的进化。而中国模型在 Token 使用量上的压倒性优势,证明了其高性价比和强大的社区影响力,是“开源模型力量”的最直接证据。 🔗 OpenRouter 推文 | 中国模型数据推文
7️⃣ 边缘 AI 的“贫民窟”革命:从 8 美元芯片跑 LLM 到免费离线写作助手#
- 核心亮点:一系列边缘 AI 项目在今天吸引关注。有开发者成功在售价仅 8 美元的 ESP32-S3 芯片上运行起约 2900 万参数的 LLM,秘诀是利用 Gemma 的 Per-Layer Embeddings 思路将大部分参数存储在 Flash 而非 RAM 中。另一款开源离线 AI 写作助手 Lexicon 发布,它通过下载本地模型(轻量版 0.8GB)在完全离线的环境下实现改写、简化等操作,可作为 Grammarly 的平替。
- 行业意义:这些项目展示了 AI 基础设施的另一面:不再是追求极致大参数,而是在资源极度受限的硬件上尽可能地“压榨”出智能。这代表了一种“普惠AI”的趋势,即让尖端技术下沉到成本极低的设备中,这对于物联网、数据隐私和偏远地区的应用具有革命性意义。 🔗 ESP32 运行 LLM | Lexicon 写作助手
⭐ GitHub 趋势#
1. obra/superpowers ⭐ 今日 +479#
语言/许可: Shell / MIT
总 Stars: 261k
仓库: GitHub
项目定位:
面向编码 Agent(Claude Code、Codex CLI、Cursor 等)的完整软件开发方法论与技能框架。通过一套可组合的技能指令集,将 Agent 从“被动代码补全”转变为能自主完成需求分析、设计、TDD 开发、代码审查的协作系统。
核心功能:
- 子代理驱动开发:将实现计划拆解为 2-5 分钟粒度的任务,为每个任务分派独立子代理执行,并附有两阶段审查(规范合规性 + 代码质量)
- 强制 TDD 工作流:在实现阶段强制执行 RED-GREEN-REFACTOR 循环,在写实现代码之前必须编写测试
- 跨 Agent 平台兼容:官方支持 Claude Code、Codex CLI、Cursor、Gemini CLI、GitHub Copilot CLI 等 7 个主流编码代理平台
- Git 工作树集成:自动为每个特性创建隔离的 Git 工作树,支持并行开发
技术亮点:
通过纯 Markdown/Shell 指令定义技能,无硬编码工具调用,Agent 在会话启动时自检并加载相关技能,实现低侵入式集成。
2. palmier-io/palmier-pro ⭐ 今日 +412#
语言/许可: Swift / GPL-3.0
总 Stars: 12.2k
仓库: GitHub
项目定位:
面向 AI 工作流原生的 macOS 视频编辑器。在 Swift-native 时间线编辑器中内置生成式 AI 能力,并通过 MCP 协议让外部 AI Agent(Claude、Codex、Cursor 等)直接操作剪辑项目。
核心功能:
- 原生生成式 AI 集成:直接在时间线内调用 Seedance、Kling 等模型生成视频/图片内容,无需切换应用
- MCP 服务器暴露:编辑进程启动后监听 HTTP MCP 端点 (
http://127.0.0.1:19789/mcp),允许外部 Agent 读取/修改时间线项目 - 内置 Agent 聊天:应用内提供集成 AI 助手,可与编辑器同项目协作
- Swift-native 性能:完全从零用 Swift 构建,对标 Premiere Pro 的编辑体验
技术亮点:
通过 MCP 协议将视频编辑器的状态暴露为结构化工具(读/写时间线、添加素材等),使 Agent 能像操作代码一样操作视频项目。
3. RyanCodrai/turbovec ⭐ 今日 +86#
语言/许可: Python, Rust / MIT
总 Stars: 14.3k
仓库: GitHub
项目定位:
基于 Google TurboQuant 算法的 Rust 向量索引库,提供 Python 绑定。用于内存受限的 RAG 场景,在降低内存占用 8 倍的同时,实现优于 FAISS 的搜索速度。
核心功能:
- 在线增量索引:向量直接添加即可索引,无需离线训练步骤、无参数调优、无需随着语料增长重建索引
- SIMD 加速搜索:手写 NEON(ARM)和 AVX-512BW(x86)内核,在 ARM 上比 FAISS IndexPQFastScan 快 10–19%
- 运行时过滤:
search()支持传入 ID 白名单或位掩码,在 SIMD 内核内直接跳过不允许的向量块,避免后过滤的性能损耗 - 框架集成:提供 LangChain、LlamaIndex、Haystack、Agno 的 drop-in 替换包,一行代码替换现有内存向量存储
技术亮点:
基于 TurboQuant 的数据无关量化器,使用随机旋转 + Lloyd-Max 量化,无需训练即可达到近乎最优的压缩失真;可选 TQ+ 校准为低维嵌入补全坐标分布偏差。
今日洞察#
中国模型在开放式聚合平台上的优势数据正在重塑”开源 vs 闭源”的讨论基础。OpenRouter 的 Token 使用量统计显示,排名前 10 的模型中中国项目占据 8 席,这不仅是数量上的碾压,更隐含着两个结构性信号:其一,中国开源模型的高性价比策略在开发者生态中已形成实际的主导性市场选择,而非媒体报道中的”另一个选项”;其二,OpenRouter 这类中立聚合平台的数据,比任何官方 PR 稿都更直接地反映了全球开发者的实际采纳决策。这一趋势的连锁影响是,闭源 API 的价格压力将持续扩大,因为开源模型的真实使用量规模正在倒逼价格竞争——当开发者可以免费或极低成本获得类似能力的模型时,API 的定价权将显著收窄。
蚂蚁开源的 LLaDA 2.2 暴露了 Agent 基础模型技术路线的一个被忽视的岔路口。传统自回归模型在 Agent 任务中需要复杂的规划框架来弥补 token-by-token 生成的局限性,而扩散 LLM 的块并行生成范式天然更适合多步推理和工具调用。LLaDA 2.2 在 τ²-Bench 上的分数(592.80)大幅领先同类自回归模型(334.90),说明扩散架构在 Agent 场景下可能不是一个”替代路线”,而是一条更具效率优势的路径。这对那些正在构建 Agent 框架的团队而言意味着:如果扩散 LLM 被证明在 Agent 任务上持续优于自回归模型,那当前大量围绕自回归模型设计的 Agent 编排层——规划分解、状态管理、工具调用序列控制——可能需要重新评估其架构假设。
边缘 AI 的”贫民窟”趋势正在成为低端 IoT 设备的 AI 能力扩张点,而非单纯的性能压缩演示。8 美元的 ESP32-S3 芯片运行 2900 万参数模型,其核心技巧是将参数存储在 Flash 而非 RAM 中,利用了 Gemma 的 Per-Layer Embeddings 思路。这看似是一个极限工程案例,但实际暴露了一个正在加速的工程事实:当模型参数量被压缩到可以通过 Flash 加载的程度,AI 能力在低端设备上的部署就不再受制于芯片算力,而只受制于存储成本。IoT 设备、离线写作助手等应用的爆发,门槛正在从”跑不跑得动”转变为”能不能跑得够便宜”。这对上游芯片设计、云端推理市场都构成了长尾冲击。
Karpathy辟谣离开Anthropic,新智具身开源3万小时触觉数据
- Karpathy回应谣言:未离开Anthropic
- GitHub Bug Bounty计划升级,新增VIP项目
- 新智具身与复旦开源3万小时触觉数据集及模型
Karpathy本人辟谣离开Anthropic的传言;GitHub更新漏洞奖励计划,新增VIP项目;Ruff 0.16.0默认规则从59增至413条;新智具身与复旦公开3万小时触觉数据及模型;Jerry Liu讨论为最新模型简化Claude Code系统提示的做法。
1. Karpathy辟谣离开Anthropic:一场误传的澄清#
- 核心事件:近期社交平台流传Andrej Karpathy已离开Anthropic的消息。Karpathy本人今日在X上公开回应,直接否认称“不知道哪里来的奇怪错误信息,不”。Gary Marcus转发了这一澄清,确认Karpathy并未离开。
- 行业意义:Karpathy作为AI领域最具影响力的研究者之一,其去向一直备受关注。此次谣言迅速传播并得到本人澄清,反映了社区对顶级人才流动的高度敏感。Anthropic在人才竞争中的稳定性得到一次正面确认。 🔗 Karpathy推文 | Gary Marcus转述
2. GitHub 更新 Bug Bounty 计划:新增 VIP 项目,重构公共奖励#
- 核心亮点:GitHub官方今日宣布其漏洞奖励计划(Bug Bounty)进入新阶段,推出新VIP项目、重构公共奖励结构,并更新信号要求,旨在建立更强的研究者合作关系。
- 具体变化:新VIP项目将面向高影响力研究者提供定向合作渠道;公共奖励结构重新调整以激励高质量研究;信号(Signal)要求更新以过滤噪音。
- 行业意义:GitHub作为全球最大的代码托管平台,其Bug Bounty计划的进化直接关系到开源生态和AI Agent所依赖的代码供应链安全。此次升级标志着安全研究从“广撒网”向“精准合作”的转变,尤其对依赖大量第三方库的AI项目具有深远影响。 🔗 GitHub官方推文 | 官方博客
3. Ruff 0.16.0 发布:Python linter 默认规则从 59 激增至 413#
- 核心发布:Astral公司开发的快速Python linter Ruff发布0.16.0版本。此版本将默认启用的规则数量从此前的59条大幅增加至413条。Simon Willison发文称这一改变在其项目中暴露了大量问题(仅sqlite-utils就出现1618处)。
- 行业意义:Ruff凭借极快的执行速度已成为Python生态中最受欢迎的lint工具之一。默认规则的7倍扩容意味着开发者无需手动配置大量规则即可获得更严格的代码质量检查,这将整体提升Python项目的代码规范性和安全性。对于依赖Python的AI项目(数据科学、后端服务)而言,这是一次重要的基础设施升级。 🔗 Simon Willison推文 | Ruff 0.16.0发布说明
4. 新智具身与复旦开源3万小时触觉数据,补齐具身智能“手感”#
- 核心发布:量子位报道,新智具身与复旦大学今日发布系列报告,公开了总计3万小时的触觉数据,项目数据与模型全部开源。这是具身智能领域迄今最大规模的触觉数据集开源之一。
- 行业意义:触觉感知一直是机器人操作的核心瓶颈。此前视觉、语言等模态数据已相对丰富,但高保真触觉数据的稀缺严重限制了机器人的精细操作能力。此次开源将直接推动从“看得到”到“摸得到”的技术跃迁,为仓储分拣、医疗手术等精密场景的机器人训练提供关键燃料。 🔗 量子位报道
5. [持续跟踪] Claude Code 系统提示削减 80%:前沿模型需要更少约束#
- 前情提要:Anthropic团队成员Thariq近日透露,为最新模型精简了Claude Code的系统提示,移除了约80%的约束性内容。
- 最新突破:LlamaIndex创始人Jerry Liu今日在X上援引并赞同这一做法。他指出自己过去倾向于编写涵盖所有边缘情况的详细prompt,但发现这会导致模型只能满足特定请求,而无法独立提供新视角(探索“未知的未知”)。他认为前置模型已经具备利用上下文和判断力做出完整决策的能力,过度约束反而适得其反。
- 行业意义:这一趋势标志着Agent提示词设计的范式转变:随着模型推理能力的提升,显式规则正从“必需品”变为“性能抑制器”。开发者需要学会信任模型,从“填空式指令集”转向“宽松的约束框架”,让模型自行判断何时、如何利用上下文。 🔗 Jerry Liu推文 | Thariq原始文章
6. Guillermo Rauch:Eve.dev 是比任何框架更基础的公司基因#
- 核心观点:Vercel CEO Guillermo Rauch今日在X上推出一系列观点,称Eve.dev是他构建过的“最基础的框架”,是公司的起源。他强调当有新想法时,不应立刻想到“去用Agent然后临时prompt”,而应思考“如何构建一个能启动、维护和壮大这个想法的工厂”。
- 延伸论述:Rauch指出,(软件)工厂本身就是产品。你的产品质量取决于你用来自动维护它的Agent有多好。他以特斯拉为例,称Elon Musk早就明白了这一点。
- 行业意义:Rauch的观点代表了AI原生公司的一种新哲学:将Agent部署和自动化视为核心竞争力,而非辅助工具。Eve.dev作为Vercel推出的产品,正在推动“软件即工厂”的范式,使Agent不再是外部辅助,而是公司组织架构的核心组件。 🔗 Guillermo Rauch推文 | 引用推文
7. 宝玉详解 Agent Skills 工作流:一次加载、Prompt Caching 降本#
- 核心亮点:技术博主宝玉今日在X上解答社区常见疑问,清晰说明了Agent中使用Skills时的实际流程。Skills的元信息(name和description)在对话一开始就作为系统提示词的一部分统一加载进上下文窗口,大模型在处理第一条消息时已知道所有可用技能。
- 关键优化:大模型在一次调用中连贯完成“读问题→对照Skill描述→决定使用哪个Skill→调用工具”的全流程,无需分两次调用。此外,Prompt Caching机制在多轮对话中缓存系统提示词,后续轮次不需要重新处理,节省时间和成本。
- 行业意义:这一解释揭示了Agent架构优化的关键细节。随着Agent使用越来越多的Skill(工具),一次性加载+Prompt Caching的设计大幅降低了延迟和token消耗。这为开发者构建具备大量工具的复杂Agent提供了可复用的优化策略。 🔗 宝玉推文