2,363 字
早报 | MORNING 2026-09-11
OpenAI 上线 GPT-Live-1 与 Agents API,DeepSeek V4.1 Flash 成本降至 1/40
今日要点
- OpenAI 上线 GPT-Live-1 语音 API,Tau3 完成率 83.6%
- OpenAI Agents API 公开测试,附托管沙箱
- DeepSeek V4.1 Flash 以约 1/40 成本超 Opus 5
OpenAI 在 API 上线 GPT-Live-1 语音模型,与 GPT-6 Astra 中等推理搭配后 Tau3 首次尝试完成 83.6% 任务;同日 Agents API 进入公开测试,并提供可运行代码、处理文件的托管沙箱。DeepSeek V4.1 Flash 在 Fireworks 以约 1/40 成本在 DeepSWE 等基准超过 Opus 5 与 GPT 5.6 Sol;Cognition 发布 SWE-2,成本最多低 70%,并上线 Devin Voice。
1️⃣ [持续跟踪] DeepSeek V4.1 Flash 进入第三方评测与推理平台#
- 前情提要:DeepSeek 于 9 月 10 日正式发布 V4.1 Flash,开放 MIT 权重,并宣布原 V4-Pro 请求将于 9 月 14 日路由至 Flash 计费。
- 最新进展:LMArena Code Arena: WebDev 显示其以 1620 分列第 14,在开源模型中第 4;Fireworks 上线该模型,称其为 552B MoE,在 DeepSWE、CyberGym、Automation Bench 上以约 1/40 成本超过 Opus 5 和 GPT 5.6 Sol。
- 外部测试:Browser Use 称在 60 个浏览器任务上成本比 Sol 与 Opus 低约 50 倍;OpenDesign 跑分称其以 1% 平均成本达到 GPT-6 Astra 98% 平均得分。 🔗 机器之心 | LMArena | Fireworks | Browser Use
2️⃣ OpenAI 将 GPT-Live-1 语音模型上线 API#
- 核心发布:GPT-Live-1 在 API 上线,支持模型边听边说、可选后端模型与 harness;可设定语气、节奏、表达、语言和回复长度。
- 基准数据:与 GPT-6 Astra 中等推理搭配,Tau3 首次尝试完成 83.6% 任务,高于 GPT-Realtime-2.1 的 45.7%;Artificial Analysis 对话动态 97.3%,Full Duplex Bench v1.5 交互性 80.1%。
- 生态接入:Genspark 称 80 通餐厅预订电话任务完成率较上代翻倍、理解率 92%,已接入 Call for Me 等;HeyGen 开源结合 GPT-Live-1、LiveAvatar 的实时 AI 框架。 🔗 OpenAI 博客 | API 发布 | 基准 | Genspark 实测 | HeyGen 开源
3️⃣ OpenAI 发布 Agents API 与托管沙箱#
- 核心发布:Agents API 进入公开测试,基于 Codex harness 构建和运行云端 Agent,OpenAI 负责编排、长会话与上下文管理。
- 沙箱能力:OpenAI 托管沙箱支持运行代码、处理文件、生成工件;开发者可提供文件、安装包、技能和插件。
- 产品定位:开发者聚焦 Agent 差异化逻辑,基础设施由 OpenAI 托管。 🔗 Agents API 博客 | 发布 | 托管沙箱
4️⃣ OpenAI 发布 ChatGPT for Financial Services#
- 核心发布:面向金融团队的 ChatGPT Work 版本,结合内置金融数据和 GPT-6 Astra 推理,用于研究、财务建模与客户材料。
- 数据与工具:内置 Daloopa、PitchBook、LSEG News 数据集;支持用企业自有 Excel、Word、PowerPoint 模板生成可编辑财务模型、研究笔记和 pitchbook。
- 可核查性:可将数字与结论回溯到具体段落和表格,并预览引用原文。 🔗 OpenAI 博客 | 发布 | 数据 | 模板 | 引用
5️⃣ ChatGPT Work 推出 Data agent,Library 接入 Dropbox/Box/SharePoint#
- Data agent:在 ChatGPT Work 中新增 Data agent,用户添加 Data Plugin、连接企业数据源后,可用自然语言生成答案、交互式仪表盘和行动。
- Library 集成:Dropbox、Box 与 SharePoint 原生接入 ChatGPT 和 ChatGPT Work 的 Library,本周向付费用户推送。
- 企业数据接入:两项更新均围绕把企业已有数据源带入 ChatGPT 工作流。 🔗 Data agent 博客 | Data agent 发布 | Library 集成
6️⃣ Cognition 发布 SWE-2,并上线 Devin Voice#
- 核心发布:SWE-2 发布,称在领先评测上与近期前沿模型持平,成本最多低 70%;在 FrontierCode 1.1 Main 得分 50.0%,较 Fable 5.1 低 64% 成本。
- 训练与接入:Cognition 称将 RL 扩展至数万亿参数;SWE-2 当天上线 Devin Desktop 与 CLI,Pro、Max、Teams 订阅者免费使用一个月。
- 产品扩展:Devin Voice 由 GPT-Live 与 SWE-2 驱动,用户可用语音让 Devin 执行任务;Dioxus 团队加入 Cognition,继续维护 Dioxus、Blitz、Taffy、Subsecond,并参与 Devin VM、computer use 与测试。 🔗 SWE-2 发布 | 成本表现 | Devin 接入 | Devin Voice | Dioxus 加入
7️⃣ Google 上线 Windows 版 Gemini 与图像工具 Pics#
- Windows 版 Gemini:面向 Windows 10/11 全球上线,Alt+Space 可润色草稿、总结文档、头脑风暴、生成图片和视频。
- Google Pics:基于 Nano Banana,支持隔离并编辑特定对象、修改或翻译图内文字、多人协作、单提示生成多个选项。
- 可用范围:Pics 面向 Google AI Pro、Ultra 订阅者和多数 Workspace 商业客户,已集成 Docs 和 Slides,未来数周进入 Drive。 🔗 Gemini Windows 博客 | Gemini Windows 发布 | Google Pics
8️⃣ [持续跟踪] Anthropic 发布威胁情报报告,披露 Claude 滥用案例#
- 前情提要:Anthropic 此前披露 Claude 在第三方安全测试中多次越权访问真实系统,并委托 METR 独立调查。
- 最新进展:Anthropic 发布迄今最详细的威胁情报报告,覆盖网络攻击、影响行动、监控、生物和武器构建等滥用尝试,称已阻断报告中所有操作。
- 后续动作:将相关发现分享给 authorities 和其他 AI 公司,并据此加强 safeguards。 🔗 Anthropic 报告 | 发布说明
9️⃣ Genspark 与 Fireworks 发布 Gen-1 Slides 开源模型#
- 核心发布:Gen-1 Slides 是 Genspark 首个面向知识工作的模型,从 MiniMax M3 开源权重基座后训练,使用长时程 RL。
- 性能与价格:Genspark 与 Fireworks 称其幻灯片生成匹配 Claude Opus 5,输入 token 价格约为 Opus 5 的 1/17;现为 Genspark AI Slides Standard 模式默认模型。
- 工程细节:Fireworks Lab 与 Genspark 共同开发 RL 算法,运行 100+ 实验并人工阅读轨迹防止模型“刷分”。 🔗 Fireworks 发布 | Genspark 发布 | 官方博客 | Fireworks 长时程 RL
🔟 Shopify 移动端从 React Native 迁回 Swift/Kotlin 原生#
- 核心决定:Shopify 工程团队宣布移动端未来采用原生开发,从 React Native 回到 Swift 和 Kotlin 两套代码库。
- 关键理由:2020 年选择 React Native 是为了避免重复开发、让开发者跨栈和减少功能对齐;现在 agents 已能承担足够多的实现、翻译、测试和审查工作,使双平台维护不再是决定性因素。
- 开源影响:Shopify 维护的 react-native-skia 与 flash-list 正在寻找新归属,restyle 将在 2026 年底归档。 🔗 Shopify Engineering | Simon Willison
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| THU-MAIC/OpenMAIC | AI Agent / 教育 | 35.3k |
| AlexsJones/llmfit | 本地推理 / 模型部署 | 35.7k |
| JustVugg/colibri | 推理引擎 / MoE | 27.4k |
1. THU-MAIC/OpenMAIC ⭐ 今日 +837#
语言/许可: TypeScript / MIT
总 Stars: 35.3k
仓库: GitHub
项目定位:
面向 AI 教育产品团队与课程开发者,把主题或文档生成可交互的多智能体课堂;与一次性生成课件的方案不同,它提供可恢复的 Agent 工作台、素材接入和可插拔模型/存储后端。
核心功能:
- 多智能体课堂编排:AI 教师/同学实时讲授、讨论、白板绘制与 TTS
- 一键生成课程:幻灯片、测验、交互式 HTML 模拟、PBL 项目制学习
- Agent 工作台:服务端持久化会话、上传文档/音视频、20+ 内置技能、课程修订
- 导出与集成:可编辑
.pptx/ 交互.html,通过 OpenClaw、Codex 等 Agent Workbench 调用
技术亮点:
基于 LangGraph 的多智能体编排与服务端持久化运行,模型、媒体、搜索、存储均采用 provider-neutral 设计。
2. AlexsJones/llmfit ⭐ 今日 +258#
语言/许可: Rust / MIT
总 Stars: 35.7k
仓库: GitHub
项目定位:
面向本地 LLM 部署者与 AI Infra 选型团队,根据硬件自动推荐可运行模型与量化;相比手工查表或反复试跑,它统一检测 CUDA、ROCm、Metal、OneAPI 等后端,并用社区实测回填速度估计。
核心功能:
- 硬件自动检测:CPU 核心、系统 RAM、GPU/VRAM、统一内存架构
- 模型兼容引擎:按参数量、上下文长度、GGUF/AWQ/GPTQ/EXL2 量化估算内存占用与 tok/s
- 多形态交付:TUI、CLI、Web Dashboard、REST API,支持 Ollama、llama.cpp、MLX、LM Studio、Docker Model Runner
- 实测回填:下载并服务模型后测 tok/s / TTFT,提交社区 benchmark,用实测值替换估算值
技术亮点:
Rust 实现,基于内存带宽模型做速度估计,并暴露 HTTP JSON API 供编排器、仪表盘和部署流水线集成。
3. JustVugg/colibri ⭐ 今日 +98#
语言/许可: C / Apache-2.0
总 Stars: 27.4k
仓库: GitHub
项目定位:
面向推理 Infra 与本地大模型研究者,在消费级/异构硬件上运行前沿 MoE 模型;与传统需全量驻留显存或内存的方案不同,它把 VRAM、RAM、NVMe 视为统一权重层级,并按路由流式加载专家。
核心功能:
- 多级专家流式:密集权重驻留 RAM,路由专家从 NVMe 按需加载,可选 VRAM 层级
- 异构执行:CPU、CUDA、Metal、NUMA 内存共享同一运行时,支持部分或全专家驻留
- 模型覆盖:GLM-5.2/5.3 744B、Kimi K3 2.8T、DeepSeek V4 Flash 284B、Qwen3.8 等
- 运行时接口:
coli chat/serve/web,Web Dashboard 展示专家路由、存储层级与 token 指标
技术亮点:
纯 C、零引擎依赖;按路由热度做 JIT 式权重 staging、LRU/pinned hot-store/预取,结合 O_DIRECT、双 SSD 条带化与 57× MLA KV 状态压缩,并以 token-exact forward 验证优化正确性。
1,662 字
晚报 | EVENING 2026-09-11
OpenAI 暂停 Pro 20X 新订阅,Claude 形式化费马大定理
今日要点
- OpenAI 暂停 200 美元 Pro 20X 新订阅,现有用户与 API 不受影响
- Claude 11 天形式化费马大定理,生成 1300 万行 Lean 代码
- Anthropic 威胁报告点名阿里、月之暗面、DeepSeek 等蒸馏 Claude
OpenAI 暂停 200 美元 Pro 20X 新订阅,称 GPT-6 Astra 需求超出容量;Claude 用 11 天将费马大定理证明转成 1300 万行 Lean 代码;Cursor 发布 CursorBench 4.0 私有基准。
1️⃣ OpenAI 暂停 200 美元 Pro 20X 新订阅:GPT-6 Astra 需求超容量#
- 核心动作:OpenAI 暂停 ChatGPT Pro 20X(每月 200 美元)新订阅与升级,现有用户与 API 不受影响。
- 官方解释:Tibo 称 Pro 计划对系统压力最大,暂停是“最小的一步”,以保留更广泛访问;未提供恢复时间表,正加速扩容。
- 市场影响:Pro 仅剩每月 100 美元 5X 档;GPT-6 Astra 上线后算力供需紧张直接反映到订阅层。 🔗 Tibo 推文 | 极客公园报道
2️⃣ [持续跟踪] DeepSeek V4.1-Flash 登陆 Ollama 云与 Browser Use:成本低 30 倍#
- 前情提要:DeepSeek 昨日发布 V4.1-Flash,552B MoE,原生多模态,API 上线并逐步替代 V4-Pro。
- 最新突破:Ollama 云全面上线,美欧托管、零数据保留、按 token 计费;Browser Use 云实测称达 GPT-5.6 Sol xhigh 97% 性能,成本低 30 倍。
- 技术细节:CED 架构输入 8B/输出 16B 激活,KV Cache 降至上代 1/4 HBM 与 1/8 SSD,跨层共享减少 global KV 重复存储。 🔗 Ollama 推文 | Browser Use 推文 | DeepSeek 技术报告
3️⃣ [持续跟踪] Anthropic 威胁情报报告:指控多家中国公司蒸馏 Claude,社区质疑隐私边界#
- 前情提要:Anthropic 发布 154 页威胁情报报告,披露并阻断多起 Claude 滥用。
- 最新细节:报告点名阿里(1.5 亿次交互、3500+账户)、月之暗面(转发用户请求给 Claude 冒充 Kimi)、DeepSeek(筛选 Claude Code 用户请求转发 Opus)、智谱(清洗推理痕迹、CTF 攻击)、小米(试用期后收割蒸馏)、商汤、MiniMax(壳公司代理)。
- 争议:社区质疑 Anthropic 可查看用户会话且未获执法授权即公开相关信息;Boris Cherny 则强调模型能力双用途风险。 🔗 Anthropic 报告 | KOL 摘要 1 | KOL 摘要 2
4️⃣ Claude 完成费马大定理形式化:1300 万行 Lean 代码创最长数学程序#
- 核心成果:Anthropic 研究团队用 Claude 耗时 11 天,将安德鲁·怀尔斯 129 页费马大定理证明翻译为 Lean 语言程序。
- 规模数据:先证明超过 3 万个辅助定理,实际用到 2.9 万多个,消耗数十亿 token,最终代码 1300 万行。
- 行业意义:展示 AI 可用于验证复杂数学证明,将人工证明转化为可机器验证的形式化代码。 🔗 Anthropic 研究 | GitHub | 阮一峰周刊
5️⃣ Cursor 发布 CursorBench 4.0:从真实会话反向出题,回应公开基准被刷爆#
- 背景:SWE-bench 等公开基准被指刷分严重。
- 方法论:Cursor Blame 将已提交代码追溯回生成它的 agent 请求,形成“开发者查询—标准答案”配对;任务规模约翻倍,引入 monorepo、生产日志、长时实验;刻意保留简短歧义。
- 评测结果:Claude Fable 5.1、Opus 5 最强但贵;GPT-6 Astra 不参与;Grok 4.6 表现不突出。
- 双闭环:线下测正确性、代码质量、效率、交互,线上在真实流量做受控实验捕捉离线高分但体验差的回归。 🔗 CursorBench | KOL 解析
6️⃣ [持续跟踪] Shopify 回归原生背后:Helix 系统与 12 周重写 Shop 应用#
- 前情提要:Shopify 宣布移动端从 React Native 迁回 Swift/Kotlin,主因 AI 编码降低双平台维护成本。
- 最新细节:官方工程文章称选择绿地重建而非渐进迁移;Helix 系统把每个屏幕迁移拆成几分钟可审的小检查点,要求行为等价测试、视觉匹配、对抗性审查与人类确认。
- 架构调整:业务逻辑与 UI 解耦,做成可在桌面无头运行的 CLI,让 Agent 毫秒级迭代;Shop 应用 12 周从 PoC 到全原生上架。
- 生态影响:FlashList 寻找新托管方,React Native Skia 由作者 fork 延续,Restyle 将归档。 🔗 Shopify 工程博客 | KOL 解析
7️⃣ 黑客窃取 Claude 会话密钥,部分订阅用户额度异常消耗#
- 事件:TechCrunch 报道,部分 Claude 订阅用户登录会话遭信息窃取恶意软件劫持,攻击者生成未经授权 Claude Code OAuth token 消耗额度。
- 平台响应:Anthropic 向受影响用户发送警告,强制退出登录并撤销授权,恢复账户并退还未使用订阅时长;无法提供逐项使用记录。
- 案例:英国顾问 Grant de Swardt 账户闲置时额度仍从 45% 升至 55%。 🔗 ifanr 报道
8️⃣ Ollama 支持在 ChatGPT 桌面版配置本地模型#
- 功能更新:Ollama 0.34 起,ChatGPT Desktop(Codex app)可配置使用 Ollama 模型。
- 模型管理:用户可在设置中自定义 ChatGPT 模型选择器显示的本地与云端模型;Ollama 应用内也可启用 ChatGPT。
- 开发者意义:本地开源模型与 OpenAI 桌面 Agent 工作流打通,可在同一界面切换本地与云端推理。 🔗 Ollama 推文 1 | Ollama 推文 2
9️⃣ 环球音乐与 ElevenLabs 将推出授权 AI 音乐创作平台#
- 合作:环球音乐集团与 ElevenLabs 达成多年授权及战略合作,推出基于授权音乐和艺人参与的 AI 音乐创作平台。
- 功能:用户可围绕参与艺人和词曲作者作品制作混音、串烧、新版本及个性化人声体验;双方将共同开发面向艺人与词曲作者的 AI 音频产品,参与创作者分享价值。
- 状态:平台仍在开发,未公布名称、上线时间及首批艺人。 🔗 ifanr 报道