Yeekal Logo Yeekal
2,880 字
早报 | MORNING 2026-07-27

GPT-5.6 Sol 解决6个开放问题,Stripe 100亿美元收购OpenRouter

今日要点
  • GPT-5.6 Sol 5天解决6个Erdős问题,提示词和证明全部公开
  • Stripe拟100亿美元收购OpenRouter,AI API网关估值翻8倍
  • Sam Altman展示ChatGPT自动规划旅行并制作网站,全程无需干预
华裔研究者Shouqiao Wang使用GPT-5.6 Sol模型在5天内解决6个开放Erdős问题,公开GitHub仓库包含证明和提示词。支付巨头Stripe被曝以最高100亿美元收购模型API聚合平台OpenRouter,收购价为最新估值的近8倍。Sam Altman演示ChatGPT从手机指令自动规划旅行、制作全栈网站并预订,标志个人AI助手进入全自主工作阶段。

1️⃣ [持续跟踪] ChatGPT/Codex自主工作能力升级:从规划旅行到数学研究#

  • 前情提要:近期ChatGPT和Codex不断展示更强的Agent能力。
  • 最新突破:Sam Altman今日在X上演示,从手机发送一条指令:“利用我的聊天历史为8个朋友规划长周末旅行,计划三个选项,制作一个全栈网站让大家协调和决定,然后做预订,并草拟邀请邮件。”ChatGPT自动完成所有步骤。他认为“work”一词不足以描述其能力。Greg Brockman转推称“ChatGPT正成为你的个人AGI”。此外,OpenAI DevEx工程师Jason Liu在访谈中展示Codex的日常使用:设置Slack/邮件酋长、将过去会话转化为技能、让Codex定期检查邮件和Linear并生成优先级概览。这些演示标志着ChatGPT/Codex从单次问答走向持续、多步骤、自主的Agent工作。
  • 行业意义:从复杂旅行规划到日常办公自动化,AI Agent已具备“一键式”解决长链路任务的能力,用户只需描述目标。这预示着个人AI助手从“聊天”到“替人工作”的范式转变。 🔗 Sam Altman推文 | Greg Brockman推文 | Peter Yang视频

2️⃣ GPT-5.6 Sol 解决6个开放数学问题,数学研究迎来AI辅助新时代#

  • 核心亮点:华裔研究者 Shouqiao Wang 使用 OpenAI GPT-5.6 Sol 模型,在5天内解决了6个开放的 Erdős 问题。他公开了所有材料:GitHub 仓库包含每个问题的证明 PDF、LaTeX 源文件、提示词和部分计算实验 Python 脚本,其中两个问题已有 Lean 形式化证明。
  • 方法论:Wang 具有数学背景,但使用的 Codex 工作流不要求深数学知识。这展示了前沿模型在数学研究中的实用价值。
  • 行业意义:这是继两周前 AI 推翻 Erdős 单位距离猜想后的又一重大数学 AI 突破。AI 正从“辅助验证”走向“问题提出与解决”的前沿,可能重塑数学研究范式。 🔗 Wang的GitHub仓库 | FinanaceYF5介绍

3️⃣ Stripe 被曝以最高100亿美元收购 OpenRouter#

  • 核心亮点:据 Andrew Curran 报道,支付巨头 Stripe 正在洽谈收购模型聚合平台 OpenRouter,交易价格可能高达 100 亿美元。OpenRouter 最近一轮估值为 13 亿美元,收购价可能是其估值的近 8 倍。
  • 行业意义:OpenRouter 是 AI 模型 API 网关的关键基础设施,统一接入数十个模型。Stripe 若收购,将获得 AI+支付的双重战略支点,也反映了 AI 基础设施的整合趋势。此交易若完成,将是 AI 领域最大并购之一。 🔗 Andrew Curran推文 | FinanaceYF5概述

4️⃣ NVIDIA 研究证明 AdamW 存在规模天花板,SOAP/Muon 大批量训练更优#

  • 核心发布:NVIDIA 团队发表新论文,声称 AdamW 在大批量训练中存在“规模天花板”。在批大小高达 1 亿 token 的下一词预测中,SOAP 和 Muon 优化器保持稳定性和质量,而 AdamW 性能下降。团队通过逐层分布式优化器与 Megatron-LM 兼容,在不近似优化器数学的前提下平衡通信和内存。
  • 行业意义:AdamW 是深度学习最常用的优化器。如果其在大规模训练中确实存在天花板,这意味着业界需要迁移到更高阶的优化器。NVIDIA 的方案提供了系统级的可行性,可能加速训练范式转换。 🔗 论文链接 | elvis概述

5️⃣ GitHub Copilot App 全面通用发布#

  • 核心亮点:GitHub 官方宣布 GitHub Copilot 桌面应用在 macOS、Windows 和 Linux 上正式 GA。推荐用户将 Copilot 应用固定在 dock 中,以随时使用 AI 编码辅助。
  • 行业意义:Copilot 从 IDE 插件扩展到独立桌面应用,支持全平台,标志着 AI 编码助手进入“随时可用”的新阶段。开发者无需打开编辑器即可与 Copilot 交互。 🔗 GitHub官方推文

6️⃣ [持续跟踪] Claude Opus 5 实际体验与基准失效:评测指标的信任危机#

  • 前情提要:Anthropic 于 7 月 25 日发布 Claude Opus 5,官方声称智能接近 Fable 5 但定价减半。昨日我们报道了初步评测分歧。
  • 最新突破:今日多位专家深度分析。Kun Chen 指出 Opus 5 几乎每项指标超越 Fable 5,但实际使用体验远不如 Fable,认为现有基准几乎完全失效。他还观察到 Anthropic 改变了训练方式:先训 Mythos 再蒸馏为 Sonnet 和 Opus,可能影响模型质量。orange.ai 补充指出“Claude 系列用起来的味道不对”,而 Grok 和 Kimi 体验更好。RLVR 只重视可验证结果,人类偏好被弱化,对齐可能失败。
  • 行业意义:基准失效和训练方式变革揭示了行业深层问题:当模型能力超越现有测试集,我们需要更鲁棒的评测方法。同时,RLVR 驱动的训练可能牺牲人类友好的交互体验,这是对齐领域的警钟。 🔗 Kun Chen推文 | orange.ai推文

7️⃣ Midjourney 收购占星 AI 公司 Co-Star#

  • 核心亮点:Midjourney 官方宣布收购个性化和占星 AI 平台 Co-Star。Co-Star CEO Banu Guler 成为 Midjourney 首席设计官,负责组建跨职能设计、产品和前端团队。Co-Star 应用将继续独立运营。
  • 行业意义:Midjourney 从图像生成扩展到个性化 AI 和社交体验。收购占星 AI 公司看似跨界,但 Co-Star 在个性化推荐和用户情感连接上有独特积累,Midjourney 可能利用其技术增强用户黏性和创意工具的情感智能化。 🔗 Midjourney官方推文

8️⃣ LLM Token 代理转售市场调查:滥用免费试用和盗刷信用卡#

  • 核心调查:Matt Lenhard 发表调查文章,揭示围绕 LLM token 转售的黑市。转售商通过滥用免费试用、利用未受保护的内部代理、甚至盗刷信用卡来获得低价 API 额度,然后以折扣价出售。在中国尤甚,使用开源代理软件(如 one-api、new-api)搭建代理池。买家寻求便宜 token、绕过地理限制和模型蒸馏。
  • 行业意义:这个市场暴露了 LLM API 计费和安全的漏洞。LLM 供应商需要提供更严格的支出上限和防滥用措施。对于开发者,将 AI 应用公开暴露面临更大的恶意消耗风险。 🔗 Simon Willison转述 | 原始调查

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
pingdotgg/t3codeAI Agent15.0k
pbakaus/impeccableAI Agent50.6k

1. pingdotgg/t3code ⭐ 今日 +149#

语言/许可: TypeScript / MIT
总 Stars: 15,036
仓库: GitHub

项目定位:
面向 AI 编码代理的轻量级 Web GUI,统一管理 Codex、Claude、Cursor、OpenCode 等多个代理的本地执行会话。

核心功能:

  • 支持多个主流 AI 编码代理作为后端引擎,通过 CLI 或桌面应用启动统一交互界面
  • 提供远程访问能力,允许在开发机上运行代理,从其他设备连接会话
  • 内置架构文档和提供者指南,便于自托管部署和扩展
  • npx t3@latest 零安装运行,降低试用门槛

技术亮点:
基于 Vite+ 构建(VitePlus),使用 vp 管理依赖,支持多平台桌面应用分发(winget、Homebrew、AUR)。


2. pbakaus/impeccable ⭐ 今日 +413#

语言/许可: JavaScript / Apache-2.0
总 Stars: 50,638
仓库: GitHub

项目定位:
面向 AI 编码代理(如 Claude Code、Cursor、Gemini CLI 等)的设计技能集,通过 23 条命令 + 60 条确定性检测规则,约束 AI 生成的前端设计质量。

核心功能:

  • /impeccable init 一键初始化项目设计上下文,生成 PRODUCT.md 和 DESIGN.md,为后续命令提供品牌、颜色、字体等规范
  • 23 条命令覆盖设计全流程:craft(从形状到代码迭代)、audit(技术质量检查)、critique(UX 评审)、polish(终版对齐)等
  • 60 条确定性检测规则(无需 LLM 和 API Key),与 LLM 审查互补,自动检查 a11y、性能、响应式等缺陷
  • 支持 12+ 个主流 AI 编码代理(Claude Code、Cursor、Codex、Grok Build、GitHub Copilot 等),通过 npx impeccable install 一键部署到本地 harness 目录

技术亮点:
设计规则以确定性代码实现,不依赖模型推理,可离线运行,保证了输出一致性;多代理 harness 结构统一,插件化部署兼容不同工具的技能目录约定。

今日洞察#

数学研究AI辅助的门槛正在消失。 Shouqiao Wang使用GPT-5.6 Sol解决6个开放Erdős问题,他在说明中强调自己虽有数学背景,但工作流不依赖深数学知识——Codex自动处理证明构造,他只需提供方向性提示。此前两周AI刚推翻Erdős单位距离猜想,两件事组合释放的信号是:前沿模型使非专家也能产出可验证的数学结果。二阶影响:数学研究将不再完全依赖顶级数学家直觉,有系统能力的工程师可能比数学家更高效地探索猜想空间,学术分工面临重构。

模型API基础设施正在经历双重挤压:一边是Stripe以100亿美元收购OpenRouter,一边是LLM token转售黑市通过盗刷信用卡获利。 OpenRouter作为统一API网关,一旦被支付巨头控制,模型分销渠道将高度集中,小型模型提供商可能丧失独立触达客户的能力。同时黑市调查揭示现有API计费防滥用机制脆弱——开发者公开暴露AI应用时面临恶意消耗风险,这将倒逼供应商快速推出更严格支出上限和身份验证手段。两条线索指向同一个结论:API经济的中间层正在成为战略节点,但安全边界远未成熟。

Claude Opus 5的基准失效与NVIDIA的AdamW天花板论文,指向AI工程共识的同步松动。 Kun Chen指出Opus 5几乎每项基准超越Fable 5但实际体验糟糕,Anthropic先训Mythos再蒸馏的做法可能解释了两者脱节。NVIDIA团队则证明AdamW在大批量训练中存在规模天花板,SOAP/Muon优化器表现更优。两件事看似无关,但都说明当前依赖的工程判断——无论是评测指标还是默认优化器——正在失效。当基准不再反映真实能力、默认优化器遇到尺度限制,行业需要重新建立从训练到评估的基础设施。

2,450 字
晚报 | EVENING 2026-07-27

DeepSeek叫停100亿融资, 开放权重公开信再添签方, Kimi K3将开源

今日要点
  • DeepSeek主动叫停第二轮100亿元融资签约
  • Kimi K3将于今晚23点开源,2.8万亿参数
  • 美团发布LoHoSearch与MineExplorer两项前沿AI评测基准
DeepSeek被曝主动暂停第二轮100亿元融资签约,据悉与美国算力差距有关;英伟达、OpenAI等联署的开放权重公开信获更多支持,HuggingFace CEO向OpenAI索要1亿美元算力;月之暗面确认Kimi K3将于今晚23点开源,2.8万亿参数;美团连发LoHoSearch与MineExplorer两项AI评测基准;Anthropic发布Opus 5提示指南并展示新应用案例。

1️⃣ [持续跟踪] 开放权重公开信博弈加剧:Anthropic未签,HuggingFace向OpenAI索要1亿美元算力#

  • 核心亮点:英伟达、OpenAI、Meta、微软等数十家公司联署的“Open Weights and American AI Leadership”公开信持续发酵。今日OpenAI CEO Sam Altman确认签署,但Anthropic仍未出现在名单中;同时HuggingFace CEO Clement Delangue就此前OpenAI模型入侵事件提出公开诉求。
  • 最新动态:HuggingFace CEO今日公开向OpenAI提出两点要求:一是完整开放该自主Agent的攻击痕迹;二是OpenAI提供价值1亿美元的算力资源,帮助HuggingFace社区加强网络防御。此外,前Anthropic安全研究员Noah Lebovic指出,黑客更倾向于使用补贴的AI订阅(Claude Code/Codex)进行攻击,而非开源模型,因为补贴模型门槛更低且禁用难度高。
  • 行业意义:从大型模型厂商的集体站队到安全社区的尖锐批评,开放与封闭的路线之争已从技术选择升级为产业战略与安全治理的核心议题。Anthropic的缺席凸显其在安全立场上的激进保守,而HuggingFace的诉求则反映出防御方对算力资源的不对称焦虑。 🔗 Sam Altman确认签署 | HuggingFace CEO推文 | Noah Lebovic线程

2️⃣ DeepSeek被曝主动叫停第二轮融资签约,或因算力缺口#

  • 核心事件:据量子位今日报道,DeepSeek主动叫停了正在进行的第二轮融资签约。此轮融资计划至少募资100亿元。HackerNews社区讨论称,泄露的会议记录显示DeepSeek管理层认为与美国存在算力差距(compute gap),因此暂停融资以重新评估战略。
  • 深层解读:梁文锋此前在投资人会议中强调“开源就是本意”和长期主义,此次叫停融资可能反映出其对当前融资环境和算力瓶颈的冷静判断,而非资金短缺。HackerNews评论指出,标题易被误解为“因泄露评论而暂停”,实际是主动策略调整。
  • 行业意义:DeepSeek作为中国开源模型的代表,其融资节奏变化直接影响全球开源生态的供给格局。算力差距的公开讨论,也揭示了中美AI基础设施竞争中的核心痛点。 🔗 量子位报道 | HackerNews讨论

3️⃣ Kimi K3确认今晚23点开源,2.8万亿参数聚焦编程与Agent#

  • 核心发布:月之暗面已在Hugging Face建立Kimi K3模型页面,显示将于北京时间7月27日23时正式开放权重下载。该模型总参数达2.8万亿,主要面向长时间编程和Agent任务。
  • 社区反应:目前已有1356人订阅发布提醒。此前Kimi K3在Code Arena上已超越Fable 5,以极高性价比引发广泛关注。开源后开发者可自行下载、部署和测试。
  • 行业意义:这是继Meta Llama、Mistral之后又一家顶级实验室将旗舰模型完全开源,标志着“开放权重”策略从欧美扩散至中国。2.8万亿参数的开源模型将极大丰富开发者选型,并可能加速Agent应用生态的繁荣。 🔗 Berryxia推文 | HuggingFace页面

4️⃣ 美团连发两项AI评测基准:LoHoSearch(搜索智能体)与MineExplorer(开放世界探索)#

  • 核心发布:美团LongCat团队今日发表两篇技术博客,分别推出LoHoSearch和MineExplorer两项全新的AI评测基准。
  • LoHoSearch:基于覆盖762万维基百科实体的知识图谱自动化生成搜索智能体题目,系统控制搜索空间与结构复杂度。最强模型GPT-5.5准确率仅34.74%,远低于BrowseComp的80%以上。平均工具调用次数从35次增至61次,现有上下文管理策略提升仅6.8%,成为下一代上下文管理研究的理想试验场。
  • MineExplorer:首个在开放世界中做到分钟级长程任务的评测基准,基于Minecraft沙盒构建813个人工验证的多跳推理任务。18个顶级模型中表现最好的Claude-Opus-4.6整体成功率仅41%,瓶颈不在感知而在推理与导航。所有数据、代码及训练环境已开源。
  • 行业意义:两项基准直指当前AI系统的核心短板——长程多跳推理与动态物理世界中的持续行动。美团从评测入手定义问题,为行业提供了可量化的能力基线。 🔗 LoHoSearch博客 | MineExplorer博客

5️⃣ 蚂蚁百灵发布Ling-3.0-Flash:原生混合推理模型#

  • 核心发布:蚂蚁百灵今日正式推出新一代原生混合推理模型Ling-3.0-Flash。该模型不依赖外部路由,在同一架构内融合快速直觉推理与慢速深度推理能力,在代码、数学、逻辑推理等任务上实现成本与性能的平衡。
  • 性能特点:在多个基准测试中接近或超越同级参数模型,同时保持低延迟与高性价比。蚂蚁表示该模型已在其内部业务场景中验证。
  • 行业意义:原生混合推理是当前模型架构的前沿方向,Ling-3.0-Flash的发布表明国内厂商在模型架构创新上正加速追赶。它为开发者在“速度快但能力弱”与“能力强但成本高”之间提供了新的选择。 🔗 量子位报道

6️⃣ Claude Opus 5应用案例全面爆发,Anthropic发布“删东西”提示指南#

  • 事件综述:Claude Opus 5发布后社区迅速涌现大量创新应用,涵盖游戏生成、物理模拟、3D建模、品牌设计、电子表格等多个领域。同时Anthropic官方发布了最新的上下文工程指南,核心主张“删掉多余指令而非增加规则”。
  • 典型案例:Opus 5支持机械臂叠碗具、制作《火箭联盟》复刻版(仅消耗27%的5x Max订阅配额)、单次通过单板滑雪物理测试、一键生成咨询水准的PPT和电子表格。这些案例印证了Opus 5在代码生成、物理模拟和精细操作方面的能力跃升。
  • 提示指南核心:Anthropic指出,“用判断力替代规则”“用接口设计替代示例”“用渐进式披露替代一次性堆砌”是新一代模型提示工程的三大法则,与HackerNews上关于Claude 5上下文工程新规则的讨论一致。
  • 行业意义:Opus 5的视觉与物理模拟能力达到新高度,使AI从“聊天工具”向“可交互的创作伙伴”进化;而提示工程范式的转变则说明,随着模型自主性提升,人工约束正从必需品变为抑制器。 🔗 Anthropic Opus 5提示指南 | 10个应用案例 | HackerNews讨论

7️⃣ NVIDIA Nemotron 3 Ultra在芯片设计RTL编码中达97.1%通过率#

  • 核心亮点:NVIDIA AI今日公布测试结果,Nemotron 3 Ultra在代理芯片设计任务中,平均通过率高达97.1%,每次迭代消耗6,629个token,在开放模型中准确率与效率均最佳。测试涵盖九类真实设计工作,模型迭代编写RTL代码、运行仿真、读取失败并重写。
  • 行业意义:芯片设计是AI agent最具经济价值的应用场景之一。Nemotron 3 Ultra的高通过率表明开源模型已具备辅助甚至部分替代硬件工程师的能力,有望显著降低芯片开发周期和成本。 🔗 NVIDIA AI推文 | 技术博文

8️⃣ Google分析1465万条Gemini对话:86%与工作无关,AI使用模式重塑#

  • 核心发现:Google今日公布对1465万条Gemini对话的大规模分析,结果显示高达86%的日常对话与工作无关,涉及个人生活、创意探索、休闲娱乐等场景。
  • 行业意义:这一数据挑战了“AI助手主要用于工作”的普遍认知,表明用户正在将AI融入生活的方方面面。对于AI产品设计,这提示需要更关注生活化场景的体验优化,而非仅聚焦生产效率。 🔗 小互转发 | 原文

9️⃣ 边缘AI里程碑:开发者在8美元ESP32-S3上本地运行29M参数LLM#

  • 核心亮点:开发者成功在仅8美元的ESP32-S3微控制器上本地运行一个28.9M参数的语言模型,生成速度约9.5 tok/s,无需联网。关键技术是采用Gemma的Per-Layer Embeddings思想,将25M参数查找表存储在慢速闪存中,每次只读约450字节,而推理核心保留在快速SRAM。
  • 行业意义:这代表了端侧AI成本的新低,使物联网设备、智能传感器等场景具备本地推理能力,对隐私保护和离线场景有重要意义。同时也展示了模型压缩与部署技术的持续进步。 🔗 GitHub项目 | HackerNews讨论