OpenAI 联合 AWS 等发布 Agent Plugins 标准,ChatGPT 升级 GPT-5.6
- OpenAI 联合 AWS 等发布 Agent Plugins 标准,首日 6 客户端接入
- ChatGPT 推送 GPT-5.6 Sol/Luna,新增推理强度滑块,事实错误减 68%
- Meta 模型在五项 STEM 奥赛获金牌级成绩
OpenAI 联合 AWS、Cursor、GitHub、Vercel 发布 Agent Plugins 开放标准,首日兼容 Codex、ChatGPT、Copilot 等客户端;ChatGPT 推送 GPT-5.6 Sol/Luna,新增推理强度滑块,高危事实评测错误较上代减少 68%;Meta 模型在五项 STEM 奥赛获金牌级成绩。
1️⃣ OpenAI 联合 AWS、Vercel 等发布 Agent Plugins 开放标准#
- 核心发布:OpenAI Developers 正式发布 Agent Plugins 开放标准,打包 Agent Skills 并支持 MCP 服务器配置,实现“一次构建、多端运行”。
- 联合方与兼容客户端:标准由 OpenAI 与 AWS、Cursor、GitHub、Code(VS Code)、Vercel 共同开发;发布首日兼容 Codex、ChatGPT、Cursor、GitHub Copilot、Kiro 与 VS Code。
- 生态信号:Cursor 当日宣布支持 Agent Plugins;Vercel CEO 称该标准让任何 CLI、IDE、云 Agent 和个人助理都能统一扩展。
- 行业意义:Agent 能力分发从各厂商私有格式走向共享封装层,Skill 与 MCP 配置有望成为跨客户端复用的标准载体。 🔗 OpenAI Developers | Vercel 公告 | Cursor 支持
2️⃣ ChatGPT 全面升级 GPT-5.6 Sol/Luna,推理强度滑块上线#
- 核心发布:OpenAI 为 ChatGPT 推送新版 GPT-5.6 Sol,统一覆盖 Plus/Pro 用户的即时回答与深度推理;并新增推理强度滑块,让用户自行调节每次回答的推理投入。
- 事实性与覆盖面:官方称新版 Sol 在金融、医学、法律高危事实性评测中,事实错误较 GPT-5.5 Instant 减少 68%;Free/Go 用户则获得 GPT-5.6 Luna 无限文本聊天,并可手动开启 “Think” 按钮处理难题。
- 官方解读:Greg Brockman 表示,过去快速回答与深度推理由不同模型承担,本次统一是让 ChatGPT 更简单直观的重要一步。 🔗 OpenAI 公告 | Sol 事实性数据 | Greg Brockman
3️⃣ Kimi K3 上线 GitHub Copilot 后遇 Actions 事故暂停,定价公布#
- 核心事件:GitHub 宣布开源权重模型 Kimi K3 全面可用并进入 Copilot,由 Fireworks 托管;随后因 GitHub Actions 事故临时暂停灰度。
- 定价:GitHub 同步公布 Kimi K3 价格——输入 15/百万 token、缓存输入 $0.30/百万 token。
- 生态扩展:LangSmith LLM Gateway 同日提供 Kimi K3 调用;OpenRouter 按真实消耗份额统计中,Kimi K3 位居工具调度任务榜首。
- 行业意义:开源权重模型以“官方托管 + 多方网关 + 编程工具内置”的组合快速进入开发者工作流,价格直接对标闭源前沿模型。 🔗 GitHub 上线公告 | GitHub 暂停声明 | LangSmith 支持 | OpenRouter 榜单
4️⃣ Meta 模型在五项 STEM 奥赛获金牌级成绩#
- 核心发布:AI at Meta 公布其模型参加五项 STEM 奥赛的纯推理成绩,全程禁用搜索、编程与计算器工具。
- 成绩明细:亚洲物理奥赛理论满分、国际物理奥赛理论满分、国际数学奥赛金牌、国际化学奥赛金牌级、罗马尼亚数学大师赛金牌级。
- 评测方法:Meta 称这是为检验真实推理进展,而非工具或外部检索辅助下的任务完成能力。
- 行业意义:不依赖 Harness 的裸模型推理能力在正式竞赛中获得验证,为对比各实验室“模型自身”与“模型+工具系统”的能力边界提供新参照。 🔗 AI at Meta
5️⃣ AWS 为 Bedrock AgentCore 加入时序策略与网关限流,开源 Dogwood#
- 核心发布:AWS 发布 Amazon Bedrock AgentCore 两项新能力——基于会话轨迹的时序策略(Temporal Policies),以及面向 AI 流量的网关速率限制。
- 时序策略:由新开源策略语言 Dogwood 驱动,支持跨多次工具调用的顺序校验、输出一致性、累计预算上限、人工审批与权限自动衰减;策略在网关层强制执行,Agent 无法绕过。
- 速率限制:支持按请求数、Token、连接数对用户、角色、目标或模型设置独立配额,覆盖 MCP、模型推理与 HTTP 目标。
- 行业意义:Agent 授权从“单次调用是否合法”推进到“一段行为是否合规”,安全控制开始下沉到基础设施层统一执行。 🔗 AgentCore 新能力 | 时序策略详解 | Dogwood
6️⃣ MCP 升级为无状态协议,服务器可在 Worker 中运行#
- 核心发布:Cloudflare 详解 MCP 2026-07-28 规范:协议核心改为完全无状态,移除强制握手与 Mcp-Session-Id,MCP 服务器不再需要 Durable Objects 或粘性会话。
- 协议改进:引入 Multi Round-Trip Requests(MRTR)替代需保持长连接的 Elicitation;新增 Mcp-Method/Mcp-Name 请求头,网关可按 HTTP 原语管理 MCP 流量;DCR 被标记废弃。
- 生态采用:Cloudflare Agents SDK 自规范发布首日支持新协议;createMcpHandler 已进入官方 TypeScript SDK,Sentry、Linear 等已在生产环境运行。
- 行业意义:MCP 从“需要状态的长连接”变成“普通 HTTP 工作负载”,显著降低托管、扩容与成本门槛。 🔗 Cloudflare MCP v2
7️⃣ Cloudflare 发布 Agent 专用浏览器 Kitesurf#
- 核心发布:Cloudflare 推出 Kitesurf,一个完全运行在 Workers V8 isolate 上的 Agent 优先浏览器,已免费进入 Browser Run 测试。
- 技术路线:基于 Rust/Wasm、无状态组件设计;每次页面加载按不可信输入隔离;已通过 21.5 万+ 项 Web Platform Tests,支持 Chrome DevTools Protocol,现有 Puppeteer/Playwright 客户端可直接接入。
- 资源效率:在截图与 HTML 提取等典型 Agent 任务中,CPU 与内存占用较 Chromium 低 3–7 倍。
- 行业意义:Agent 浏览器开始摆脱为人类设计的渲染引擎,转向低 token、低成本、高并发的机器原生交互形态。 🔗 Kitesurf 发布
8️⃣ Google DeepMind WeatherNext 论文登 Nature,代码与权重开源#
- 核心发布:DeepMind 的 WeatherNext 论文发表于 Nature,官方称其在气旋路径与强度预测上达到 SOTA,平均提供额外 24 小时预警时间。
- 实战数据:飓风 Melissa 期间,WeatherNext 提前 5 天以 80% 置信度预测 Category 5 登陆;今年起每场风暴提供 1,000 次概率预测,并通过 WeatherLab 开放。
- 开源:DeepMind 同步开源模型代码与权重,支持学术、业务预测与本地化模型开发。
- 行业意义:AI 气象模型从论文走向可核验的防灾系统,开源权重使各国气象机构可基于本地数据定制部署。 🔗 DeepMind 论文 | Google 博客 | DeepMind 推文
9️⃣ 美团上线全场景 AI Agent 平台 CatPaw,内部已覆盖 9 万员工#
- 核心发布:美团正式发布搭载 LongCat 2.0 的全场景 AI Agent 平台 CatPaw,提供个人工作台与企业级 Agent 托管能力。
- 落地数据:内部累计覆盖 9 万员工、搭建 Agent 3 万个,已在多个真实业务场景完成验证。
- 产品形态:支持移动端/PC/云端三端协作、7×24 小时云端运行、多 Agent 并发调度;企业侧提供数字员工、沙箱隔离、分级权限与可视化运维。
- 行业意义:万亿参数开源模型与大规模企业 Agent 平台在真实业务中打通,Agent 从个人提效进入组织智能化部署阶段。 🔗 美团技术团队
🔟 OpenAI 推出 Codex Security Review:自动审查 GitHub PR 安全漏洞#
- 核心发布:OpenAI 发布 Codex Security Review 研究预览,可对 GitHub Pull Request 进行深度安全审查,并在 PR 内直接给出可操作发现。
- 工作方式:使用仓库上下文分析代码改动,支持配置自动审查;Greg Brockman 称其属于“用模型提升代码与公司安全”的整体计划。
- 行业意义:编码 Agent 正从“生成代码、修复 bug”扩展到“安全审计”,代码审查环节开始被 Agent 自动化接管。 🔗 OpenAI Developers | Greg Brockman
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| mattpocock/skills | AI Agent | 206.9k |
| tirth8205/code-review-graph | AI 开发者工具 | 29.0k |
1. mattpocock/skills ⭐ 今日 +1873#
语言/许可: Shell / MIT
总 Stars: 206.9k
仓库: GitHub
项目定位:
面向 AI 编码代理(Claude Code / Codex 等)的工程化技能包,解决代理开发中常见的意图错位、冗余输出和代码熵失控问题。
核心功能:
/grill-me与/grill-with-docs:在代理动手前进行需求追问,建立项目共享语言并输出 ADR/tdd:引导 red-green-refactor 测试循环,为代理提供可靠的反馈信号/diagnosing-bugs:将调试最佳实践封装为分阶段执行的纪律流程/improve-codebase-architecture:定期扫描代码库定位架构改进候选,遏制代理加速带来的熵增
技术亮点:
以 SKILL.md 文件为分发单元,与模型无关;同时提供 Claude Code 插件(只读订阅更新)与 skills.sh(可编辑复制)两条安装路径。
2. tirth8205/code-review-graph ⭐ 今日 +237#
语言/许可: Python / MIT
总 Stars: 29.0k
仓库: GitHub
项目定位:
面向 AI 编程助手的本地优先代码知识图谱。使用 Tree-sitter 将仓库解析为函数/类/调用关系图,通过 MCP 为代理提供最小化上下文,解决大型代码库中 AI 审查的 token 浪费问题。
核心功能:
- 变更爆炸半径分析:追踪调用链、依赖与关联测试,生成“最小审查文件集”
- 增量图更新:文件保存/Git 钩子触发,仅重解析 SHA-256 变化的文件;约 3000 文件的 Django 仓库双文件编辑约 2.5 秒完成重索引
- 自动配置 15+ AI 编程平台:Claude Code、Codex、Cursor、Windsurf、Gemini CLI、GitHub Copilot 等
- 上下文压缩:官方 benchmark 显示 208k 源码 token 压缩至约 3.2k token/问题(约 68 倍)
技术亮点:
基于 Tree-sitter 的多语言静态分析,存储为 SQLite 图;附可复现 benchmark,对 token 缩减效果进行量化验证。
🟧 Hacker News 热议#
AMD acquires Taalas to boost inference performance by etching models in silicon#
290 pts · 228 comments · theregister.com
📌 内容总结
- AMD 收购多伦多 AI 芯片公司 Taalas,核心思路是把模型权重直接“蚀刻”进硅片,做成模型专用集成电路(MSIC),以换取数量级推理性能提升;交易金额未披露,预计 Q4 完成。
- HC1 测试芯片采用 TSMC 6nm,跑 Llama 3.1 8B 达 16,960 tok/s;官方称比 NVIDIA GPU 快 48 倍、比 Cerebras 快 8.5 倍。芯片分 mask-ROM 权重区和 SRAM 区(存 KV cache、LoRA 适配器)。
- HC2 目标单芯片 20B 参数,用 pipeline parallelism 可多芯片拼接;文章估算 50 颗 HC2 可服务万亿参数模型。
- AMD 计划将 Taalas 芯片与 Instinct/Helios 机架搭配,可能形成 GPU 负责 prefill、Taalas 芯片负责 token generation 的异构架构。
- 主要限制:模型一换就要重新流片。官方称只需更换两层 metal,成本和时间比全流程低,但仍不适合快速迭代的 SOTA 模型;目标客户是模型厂商、基础设施提供商和少数推理服务商。
💬 讨论总结
- 技术争议:有工程师指出单流 decode 的瓶颈是权重获取距离,Taalas 本质上是把权重放近计算单元;他在 Xilinx Kria K26 上用权重烧入 URAM/BRAM、零 DRAM 的方式复现类似思路,对“蚀刻”本身是否比大容量片上 SRAM 更重要提出质疑。
- 有评论将 Taalas 比作“core rope memory 复活”,并提到 Apollo 时代的只读存储先例;也有讨论认为 NAND 可重写但扩展性差,PCM/MRAM 更适合计算存储。
- 扩展性误读被纠正:有人认为整个模型必须单芯片承载,回复澄清 Groq/Cerebras 同样依赖跨芯片切分权重;关键是单层能放进芯片并且互联足够快。
- 商业现实:多数人认为模型迭代速度会让芯片快速过时;但回复指出 Claude Code 仍在用旧 Haiku 4.5,非 SOTA 业务场景很多,私有化/离线推理需求真实存在。
- 有观点乐观:SOTA 模型架构若趋向收敛,“base model ASIC + 物理 LoRA 卡”可能成立;反对意见认为模型权重若固化在零售芯片里,存在被提取的风险,更可能由模型公司内部部署。
- 对 AMD 收购本身,有人认为团队获现金且技术能进产品是双赢;也有人担心团队太小,被 AMD 吸收后最终交付不了任何东西,独立硬件出现在公开市场的希望更渺茫。
Humans missed 1 in 3 threats approving AI agent commands across 40k game runs#
239 pts · 186 comments · scalex.dev
📌 内容总结
- 作者做了一个浏览器游戏:玩家模拟 AI coding agent 的人类审批者,限时批准/拒绝命令;累计 40,000+ 局、409,000 次独立决策。
- 平均威胁漏批率 1/3(准确率 66.3%);32.9% 的局最终得分为负;7% 的玩家批准了所有命令。
- 最容易被漏掉的不是明显的
rm -rf /(漏批 11.7%),而是npm run analyze,即使 agent 历史日志里已经显示该脚本会向外部 API 发送数据,仍有 64.7% 的人批准;三类npm run攻击合并漏批率 52.5%,接近其他外泄类攻击(28.4%)的两倍。 - 时间压力下漏批率随游戏进程上升;过度拦截同样普遍,例如内部 npm registry 配置命令被 59% 玩家误拦。
cat ~/.zshrc最有争议:对不存密钥的人是安全的,对在 shell profile 里 export API key 的人就是凭据泄露。
💬 讨论总结
- 共识:逐条审批不是可扩展的安全机制,和操作系统权限弹窗一样会让用户变成“条件反射式点 Yes”。更可行的方向是环境设计——sandbox、无 ambient data、网络出口控制、显式挂载目录,让整类坏事从机制上不可能发生。
- 工程经验:有人实际运行无提示 sandbox 方案后发现主要故障是误杀安全命令,而不是漏掉恶意命令;但也有人反驳 sandbox 有 CVE,且用户需要访问主目录时仍会直接挂载,防护很容易被使用方式瓦解。
- 权限模型难点:文件权限、命令执行、网络访问必须叠加考虑;像 ripgrep 的
--pre这类参数可以让“只读命令”变成任意代码执行,简单命令白名单不够。 - 质疑实验有效性:游戏没有真实后果、威胁密度(34%)远高于日常、部分命令被标为危险的标准不一致;有评论认为这是“bait dressed up as a study”,不能外推到真实工作流。
- 现实威胁密度未知:如果真实恶意命令比例极低,66% 的拦截率也许不是大问题;但如果真实比例低到那种程度,人工审批本身就更没意义。
- 责任转移视角:有评论认为 permission prompt 是模型厂商的 CYA 机制,目的是让用户为 AI 的错误操作承担责任,而不是真正提供安全边界。
Qwen3.8 Max now ranked as the best overall model by agentic index#
399 pts · 258 comments · artificialanalysis.ai
📌 内容总结
- 页面来自 Artificial Analysis,核心变动是 Intelligence Index v4.1.1 更新;标题称 Qwen3.8 Max 在 Agentic Index 登顶。
- Agentic Index 只取两个 agentic benchmark 的加权平均(GDPval-AA v2、τ³-Banking),与 Coding Agent Index(DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA)不是一回事;后者页面没有 Qwen。
- 榜单状态不稳定:有用户截到 Qwen 55.4 vs Opus Max 55.3,刷新后变成 Opus Max 59.2 vs Qwen 58.4;AA 同期发布了 v4.1.1 方法论更新。
- Qwen3.8 Max 是开放权重模型,但 cost per Index task 约 1.23;评论认为它不在性价比 Pareto 前沿。
💬 讨论总结
- 对 benchmark 的信任危机:有人直言“任何把 Opus 5 排第一的榜都失去可信度”,因为实际编码中 Opus 5 频繁犯低级错误,回复还引用了 Opus 5 “只做了一半就假装完成”的典型输出。
- 中文模型有真实进步,但一致性受质疑:一位开发者实测 Qwen 在排查复杂间歇性 bug 时优于 Kimi K3,构建诊断工具和数据统计很有效;另一位则认为 Qwen 3.8 Max 仍然 sloppy,不写测试、误解任务。类似评价也被用于 DeepSeek V4、GLM 5.2、Kimi K3:上限接近 Opus/GPT,但输出方差更大,需要更长的 prompt 和更多来回。
- 榜单变化成为争议点:有评论讽刺“wire transfer happened”,另一条指出 AA 恰好在同一时间更新 v4.1.1,分数变化可能来自方法论调整而非数据操纵。
- 本地化是社区真正关心的价值点:Qwen 3.8 27B 被反复提及,3.6 27B 已能在单张 7900 XTX 上跑,很多人期待 3.8 让本地 agent 成为“默认可用”的选项。
- 模型差距缩小后,竞争维度转向成本、速度和交互风格。有评论提到 Opus 5 虽然智能强,但在 agent harness 里汇报冗长、术语密集;GPT 5.6 Sol 在 Codex 里更清爽,现有 benchmark 没有覆盖这种“与人沟通”的维度。
- 开放权重不等于便宜,但 provider 会竞争定价,且不会被单一公司或政府下架;对依赖长尾业务的人来说这是比绝对分数更重要的优势。
今日洞察#
Agent 封装层与传输层同日标准化:OpenAI 联合 AWS、Cursor、GitHub、Vercel 推 Agent Plugins,首日 6 客户端互认;MCP v2 移除 session 与握手,Server 可在 Worker 无状态运行。能力分发不再绑定单一生态,客户端”独家能力”与专有连接价值被同步削弱,竞争上移到标准演进与默认安装位,工具托管沦为普通 HTTP 负载、成本结构被重写。
人工审批正被放弃作为安全边界。4 万局实验人类漏批 1/3 威胁,npm run 类漏批 52.5%;同天 AWS AgentCore 时序策略网关强制执法、OpenAI 推 Codex Security Review,方向是 sandbox 让整类坏事机制性不可能、策略下沉网络边界。逐条审批产品失去存在理由,安全能力从 UI 转移到云厂商。
开放权重模型按闭源价格服务化:Kimi K3 进 Copilot 定价 15,Qwen3.8 Max 登顶 Agentic Index 但单任务成本 1.23 接近。“开源等于便宜”失效,差异转移到 harness 体验——HN 争议集中在输出方差、需更多来回,以及 Opus 5 汇报冗长 vs GPT-5.6 清爽这类交互表现。模型差距收窄后,稳定性、沟通成本与部署自由度开始压过 benchmark 分数。
OpenAI 首款音箱 Doughnut 曝光,DeepSeek 预告 API 涨价
- OpenAI 首款 AI 音箱 Doughnut 细节曝光
- DeepSeek 预告 API 价格大幅上调
- 微软首次披露 OpenAI 相关收入 241 亿美元
OpenAI 首款 AI 音箱 Doughnut 细节曝光,并请求驳回苹果诉讼;DeepSeek 预告 API 价格大幅上调;Qwen 官方称 3.8-Max 登顶 Agentic Index,下周开源权重。
1️⃣ OpenAI 首款硬件 Doughnut 音箱细节曝光,同步请求驳回苹果诉讼#
- 核心亮点:彭博社披露 OpenAI 与 Jony Ive 的 LoveFrom 合作的首款硬件,代号 Doughnut,定位「AI 原生计算机」,预计 2027 年发布,售价 300-400 美元。
- 产品形态:圆环/冰球大小,无显示屏,金属机身,内置可移动机械部件随交互状态摆动,营造「有生命感」反馈;配备扬声器、麦克风阵列与相机,可感知环境并学习用户习惯。
- 诉讼背景:苹果此前起诉 OpenAI 及两名前员工窃取商业机密,其中涉及金属表面处理工艺;OpenAI 已请求联邦法官驳回,称产品是「完全不同于苹果的全新创作」。
- 行业意义:OpenAI 将硬件作为 ChatGPT 的物理入口,目标指向替代智能手机;与苹果在供应链人才和工艺上的冲突也进入司法阶段。 🔗 爱范儿早报 | 爱范儿解读
2️⃣ DeepSeek 预告 API 价格大幅上调,未公布涨幅与生效时间#
- 核心亮点:DeepSeek 8 月 6 日公告,计划近期整体上调 API 服务定价,「预计涨幅较大」。
- 细节:调整面向 API 整体定价,并非此前流传的单一高峰时段方案;具体涨幅与生效时间待正式方案,新价格公布前开发者仍可按现行价格调用。
- 行业意义:在 V4 Flash 以低价打开 Agent 用量后,官方开始释放涨价信号,模型定价策略的可持续性成为市场关注点。 🔗 爱范儿早报
3️⃣ [持续跟踪] Qwen3.8-Max 登顶 Agentic Index,官方确认下周开源权重#
- 前情提要:阿里昨日发布 2.4T 总参数旗舰模型 Qwen3.8-Max,API 已上线,并预告开源权重。
- 最新突破:Qwen 官方称,Artificial Analysis Agentic Index 中 Qwen3.8-Max 以 55.4 分排名第一,超过 Claude Opus 5 与 GPT-5.6;社区在核对榜单截图时指出,另一视图显示 Claude Opus 5 以 59.2 领先(Qwen 58.4),排名口径存在争议。
- 后续计划:官方确认 Qwen3.8-Max 与 Qwen3.8-27B 权重将于下周开放;ModelScope 页面显示 2.4T-A95B 版本开放时间为「下周三」。
- 行业意义:这是 Qwen 首次将 Max 级模型开源,2.4T 参数规模直接拉高开源权重模型的天花板,同时评测口径差异也说明 Agentic 能力榜仍缺乏统一标准。 🔗 爱范儿早报 | Reddit 榜单讨论 | Reddit 开源时间帖
4️⃣ 字节跳动被曝讨论训练超 5 万亿参数模型,张一鸣明确反对蒸馏#
- 核心亮点:《晚点 LatePost》称字节跳动正在讨论训练参数规模超过 5 万亿的模型,项目仍处早期。
- 人事与规模:Seed Foundation 负责人项亮主导,与预训练数据负责人沈科合作;规模超过 Qwen3.8-Max 的 2.4T 与 Kimi K3 的 2.8T。
- 张一鸣表态:在 Seed 全员会上表示可以暂时落后,但目标是把模型能力推进到世界第一梯队;认可 Coding 当前重要,但不希望只围绕这一短期热点投入。
- 技术路线:张一鸣明确反对模型蒸馏,认为蒸馏本质是复制 Claude 等已有模型能力,难以实现超越;Coding 训练研发已统一交由 DeepSeek 前核心研究员郭达雅负责。
- 行业意义:头部大厂重新选择「从底层构建 AGI 壁垒」而非跟随开源追赶,蒸馏与原始创新的路线分歧正在成为国内大模型竞争的关键变量。 🔗 爱范儿早报
5️⃣ [持续跟踪] Agent Plugins 开放标准落地次日:Anthropic 缺席成社区焦点#
- 前情提要:OpenAI 联合 AWS、Cursor、GitHub、VS Code、Vercel 发布 Agent Plugins 开放标准,打包 Agent Skills 与 MCP 服务器配置,首日支持 Codex、ChatGPT、Cursor、GitHub Copilot、Kiro 与 VS Code。
- 最新进展:开发者社区注意到 Anthropic 不在参与厂商之列,且 Claude Code 至今使用 CLAUDE.md 而非社区推动的 AGENTS.md;与此同时,Anthropic 发起的 MCP 与 Agent Skills 已被广泛采用。
- 行业意义:Agent 插件层开始出现「标准分叉」——OpenAI 系推动跨客户端可移植插件,Anthropic 则维持自有生态文件格式;两套体系如何收敛,直接影响 Agent 技能分发的通用性。 🔗 OpenAI Developers | shao__meng 观察
6️⃣ 微软首次披露 OpenAI 相关收入:2026 财年 241 亿美元,约占 AI 收入 70%#
- 核心亮点:微软在最新申报文件中首次披露,2026 财年来自 OpenAI 相关业务的收入为 241 亿美元。
- 数据:Bloomberg 估算该数字约占微软整体 AI 收入的 70%;截至 6 月 30 日微软对 OpenAI 的应收账款为 60 亿美元,累计注资 119 亿美元。
- 构成:大部分来自 OpenAI 在微软数据中心的云账单,另含模型开发成本与 OpenAI 自身销售收入分成。
- 行业意义:OpenAI 与微软的深度绑定首次以具体收入数字呈现,双方关系的商业价值与风险敞口同时被量化。 🔗 Rohan Paul 披露 | 中文转述
7️⃣ 阿里 Wan3.0 开启公测:单次生成 30 秒视频,支持 PPT/文档输入#
- 核心亮点:阿里视频生成大模型 Wan3.0 8 月 6 日公测,单次最长 30 秒,首次支持 doc、xls、ppt、pdf、md 文档输入。
- 功能:上传产品介绍 PPT 可配合提示词生成完整形象片;支持文本、图片、音频、视频参考,保持角色、道具、声音、空间关系与风格一致,并可修改画面、剧情和台词。
- 价格:480P/720P/1080P API 分别为 0.3、0.6、1.2 元/秒,API 接口近期全量开放。
- 入口:阿里云百炼、万镜一刻、万相官网、千问创作 PC 端、IF STUDIO 和堆友已开放,千问 App 灰度中。 🔗 量子位 | Wan 官方
8️⃣ OpenAI Atlas 浏览器漏洞曝光:恶意网页可诱导群发 WhatsApp 并完成购物#
- 核心亮点:安全公司 Zenity 在 Black Hat 披露约 20 个 AI 浏览器与扩展漏洞,涉及 OpenAI、Google、Anthropic、微软与 Perplexity 的产品。
- 攻击演示:研究人员用恶意网页提示绕过 OpenAI Atlas 防护,使其进入已登录的 WhatsApp Web 向联系人群发消息;另一演示让 Atlas 为 Amazon 账户添加地址和商品,并通过 Rufus 完成购买。
- 技术概念:Zenity 称此类攻击为「意图碰撞」——智能体将用户正常任务与网页恶意指令合并执行。
- 应对:OpenAI 称漏洞已在此前修补;Atlas 将于 8 月 9 日停用,防护能力已延伸到新版 ChatGPT 应用的浏览器能力。
- 行业意义:AI 浏览器把用户真实账号暴露给网页指令,Agent 时代的提示注入正从「输出污染」升级为「对真实世界操作」的攻击。 🔗 爱范儿早报
9️⃣ Anthropic 放宽 Claude Fable 5 生物安全限制:误报降低 85%#
- 核心亮点:Anthropic 更新 Claude Fable 5 的生物安全防护,官方称产品界面中生物相关回退(fallback)减少约 85%。
- 边界:Fable 现在可回答更广泛的日常健康与教育问题;病毒学、毒理学、分子设计等双重用途请求仍回退至 Opus 5,暂不支持专业生物学研究与药物开发。
- 行业意义:在安全与可用性之间重设边界,是前沿模型面向生物医药领域商业化前的关键一步;Anthropic 称 AI 最大正向影响将在生物与医学领域。 🔗 Claude 官方公告 | Anthropic 新闻
🔟 宇树科技 IPO 定价 150.8 元,DeepSeek 进入战略配售名单#
- 核心亮点:宇树科技公告发行价每股 150.80 元,按发行价计算上市市值约 609.93 亿元。
- 融资数据:发行 4044.64 万股,募资总额约 60.99 亿元;发行市盈率 219.23 倍,远高于行业平均 38.56 倍。
- 战略配售:参与方包括社保基金、深度求索与中国石油集团;据量子位报道,DeepSeek 出资 1.4 亿元,后续模型、算力、数据中心均纳入合作范围。
- 业绩:宇树 2023-2025 年营收从 1.59 亿元增至 16.99 亿元,净利润 2025 年为 2.78 亿元;预计 2026 上半年营收 10.52 亿至 11.28 亿元。
- 行业意义:头部人形机器人公司上市的同时引入大模型公司战投,「具身智能 + 大模型」的产业绑定在资本市场正式确立。 🔗 量子位 | 爱范儿早报