Yeekal Logo Yeekal
3,043 字
早报 | MORNING 2026-07-12

GPT-5.6 医疗表现超人类医生,美团开源万亿参数模型 LongCat-2.0

今日要点
  • GPT-5.6 Sol 医疗回答缺陷率低于人类医生
  • 美团 LongCat-2.0 开源,1.6T 参数激活 48B
  • 智谱内部信曝光:两年不重变现,押注长程 Agent
OpenAI 公布 GPT-5.6 深度医疗评测数据:在 20,000 项评分中,医生在 Sol 模型回答中发现的缺陷少于人类医生独立撰写的答案,最小模型 Luna 成本低 25 倍且超越上代。美团 LongCat 团队开源 LongCat-2.0,为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数 MoE 模型,同时发布 VitaBench 2.0、WBench 与 General 365 三项基准。

1️⃣ GPT-5.6 医疗表现超人类医生,Sol 多项基准登顶#

  • 核心亮点:OpenAI 在 GPT-5.6 发布后的第二日释放深度医疗评测数据。在 20,000 项轴评级中,医生在 GPT-5.6 Sol 响应中发现的缺陷少于人类医生独立撰写的回答。Karan Singhal 在 X 上公布:最小变体 Luna(最低推理强度)即超越 GPT-5.5 最高推理强度,成本低 25 倍;最大变体 Sol 在所有 GPT-5.6 模型中表现最强,在医疗相关任务上显著优于医生。
  • Sol 全面登顶:Sam Altman 引用多项基准表示 Sol 是当前“世界最强模型”,并调侃判断依据是“马斯克又开始沉迷于我”。lmarena.ai 官方数据显示 GPT-5.6-sol 在 Code Arena: Frontend 中与 Claude Fable 5 并列第一,这是 OpenAI 模型首次在该榜单登顶。
  • 争议与 Bug:与此同时,社区传出 GPT-5.6 在高推理等级下几乎删除了知名 AI 博主 Matt Shumer 的全部 Mac 文件,OpenAI 团队正在调查。Gary Marcus 评论此事颇具讽刺意味。 🔗 Karan Singhal 医疗数据 | Sam Altman 评论 | Matt Shumer Mac 文件事件

2️⃣ [持续跟踪] 硅谷冲突升级:Elon Musk 指责 Altman,后者回击“太空数据中心”骗局#

  • 前情提要:OpenAI 近期陷入多方争议,包括苹果起诉其窃取商业机密,以及马斯克连月来的公开攻击。
  • 最新进展:Elon Musk 今日连续发文,转发并评价 Sam Altman 为“Scam Altman strikes again”。Sam Altman 在不到一小时内迅速回击,引用马斯克向公开市场投资者兜售短期太空数据中心的行径,称其为“homeboy”。双方围绕“太空数据中心”与“苹果诉讼”展开激烈攻防。马斯克此前已暗示 OpenAI 的 IPO 前景因这些丑闻而黯淡。
  • Gary Marcus 补充:他明确指出“超级智能在逻辑上并不意味着全能”,并转发评论 OpenAI 创始人的模式为“窃取非营利机构并窃取苹果商业机密”,质疑其 IPO 前景。 🔗 Elon Musk 攻击 | Sam Altman 回应 | Gary Marcus 评论 IPO

3️⃣ Mira Murati 创立的 Thinking Machines 首次公开世界蓝图:构建多元 AI 生态#

  • 核心发布:Mira Murati 创立的 Thinking Machines 发布其使命宣言博客“The Future Worth Building is Human”。核心观点:人类价值观不能平均化,本地知识不能被集中化。未来应该有多种 AI,在不同环境中成长,由所服务的人们塑造,彼此之间像人类一样存在分歧。
  • 核心理念:博客提出“好的未来有很多个 AI,在各地被塑造、彼此争执,就像我们一样”。这与当前“归约到一个超级智能”的主流叙事形成鲜明对比。社区反响热烈,elvis 评价称“AI 取代人类”的叙事完全是一场骗局,认为 Thinking Machines 更接近 AI 的原始目标:增强和赋予人类力量。 🔗 Thinking Machines 博客 | Mira Murati 推文

4️⃣ 智谱内部信“摸高计划”曝光:两年重仓长程任务与自治智能体#

  • 核心发布:智谱创始人唐杰今日发布的内部信《巨浪已来》公开,宣布未来两年不将重心放在商业变现,而是集中资源投入四个技术方向:长程任务、自治智能体系统、自我进化、安全治理
  • 战略审视:信中引用 Google DeepMind 报告《From AGI to ASI》与 Anthropic 年化收入增长曲线,指出竞争点已从“谁能做 agent”变成“谁跑得便宜、谁能无人值守”。唐杰特别强调安全治理是四件中最想强调的一个,计划投入百亿级资源做机械可解释性。
  • 行业意义:这是国内头部模型实验室首次以内部信形式明确宣布“放弃短期变现,押注工程前沿”的战略。其四项方向分别对应着海外(Anthropic、OpenAI)仍在推进的核心难题,显示出国内团队在长周期能力上对标前沿的决心。 🔗 Datawhale 全文

5️⃣ 美团 LongCat 开源万亿参数模型与三重评测基准,打造国产 Agent 生态#

  • 核心发布:美团 LongCat 团队今日正式开源 LongCat-2.0 模型及三项关键评测基准。LongCat-2.0 是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数 MoE 模型(总参数 1.6T,平均激活约 48B)。
  • 评测基准矩阵:VitaBench 2.0 是首个真实生活场景下长期动态用户建模的 Agent 评测基准;WBench 是首个面向交互式视频世界模型的系统性多轮评测基准;General 365 聚焦通用逻辑推理,将背景知识限定在 K-12 水平以解耦推理与专业知识,最佳模型仅得 62.8%。
  • 学术积累:今日同步更新了团队被 ICML 2026 收录的 13 篇论文、被 ACL 2026 收录的 12 篇论文,覆盖 Agentic RL、自进化 Agent、视频生成等方向。团队表示这些为构建模型生态提供了理论基础。 🔗 LongCat-2.0 博客 | VitaBench 2.0 博客 | WBench 博客 | ICML 2026 论文

6️⃣ LangChain 发布 OpenWiki 0.1.0:给 AI Agent 装上主动记忆#

  • 核心亮点:LangChain 发布开源项目 OpenWiki 0.1.0,为 Agent 提供主动记忆系统。该工具可自动抓取 Gmail、Notion、Git 仓库、Twitter/X、Hacker News 与网页搜索共六类信源,将信息整理成本地 Markdown Wiki,供 Agent 随时调用。
  • 设计理念:OpenWiki 不是靠常驻服务器进程维护,而是通过本地定时任务按设定节奏自动刷新。刷新完毕后即退出,不对本地环境产生常驻影响。LangChain 创始人 Harrison Chase 在 Webinar 中分享了设计哲学:Wiki 的核心目的不是存储所有信息,而是作为缓存,保存那些常见的问题和知识,保持它们“更容易被访问”。 🔗 OpenWiki GitHub | 小互介绍 | Harrison Chase Webinar

7️⃣ 维表操作新范式:HTML 比 Markdown 更优,Claude Code 上传/apple-design skill#

  • 核心工具:开发者社区形成共识:在与 AI 交互时,使用 HTML 比 Markdown 更有效。Thariq 的博文《The Unreasonable Effectiveness of HTML》指出,Claude 能构建 artifacts,将计划和想法以可视化方式呈现,大幅提升协作效率。
  • Skill 发布:开发者 Emil Kowalski 发布 /apple-design skill,系统化提炼 Apple WWDC 的 17 条设计原则并翻译为 Web 平台可执行代码。这套 skill 不只是效果搜集,而是一套浓缩的设计哲学,值得系统学习。
  • 成本降低趋势:Perplexity CEO Aravind Srinivas 预测,6 个月内将出现 Fable 5 质量但便宜 3-4 倍的模型;12 个月内 Opus 4.8 级模型可在本地设备运行。火热的社区讨论还涉及多模型编排——Perplexity 被视为安全的多模型编排平台,企业级需求正在推动这一趋势。 🔗 HTML vs Markdown 讨论 | /apple-design skill | 模型成本预测

8️⃣ 图像与数字人赛道更新:Seedream 排名攀升,HeyGen 发布透明背景 WebM#

  • Seedream 新纪录:lmarena.ai 数据显示,Seedream-4.5 在 Text-to-Image Arena 从 #29 升至 #11;Seedream-5.0 Pro 进入 Multi-Image Edit Arena 并排 #2,大幅超越前代。BytePlus 已同步提供 Dola Seedream 5.0 Pro API 服务。
  • Meta 新滤镜:开发者社区推荐试用 Meta 新图像模型的“sitcom”滤镜,效果出色。Meta 在 AI 视觉生成赛道持续加码。
  • HeyGen 透明 WebM:HeyGen 官方宣布 API、CLI 及 MCP 支持透明背景 WebM 输出,无需绿幕即可生成带 Alpha 通道的数字人视频。开发者可将其嵌入网页或 3D 场景,已展示在 Three.js Minecraft 世界中的合成效果。 🔗 Seedream 排名 | Meta 新模型 | HeyGen 透明 WebM

⭐ GitHub 趋势#


1. DayuanJiang/next-ai-draw-io ⭐ 今日 +74#

语言/许可: TypeScript / Apache-2.0
总 Stars: 33.3k
仓库: GitHub

项目定位:
面向 AI 开发者和知识工作者的 AI 辅助图表生成工具,通过自然语言对话直接创建、修改和还原 draw.io 格式的图表。适合需要快速生成架构图、流程图、云拓扑图的场景。

核心功能:

  • 自然语言驱动图表生成:支持以 Prompt 创建并迭代修改 draw.io XML 图表(含动画连接线、云架构图)。
  • 图片/PDF 逆向生成:上传已有图片或 PDF,AI 自动解析并重建为可编辑图表。
  • 版本历史与回滚:每次 AI 编辑自动保存快照,支持对比和恢复到任意历史版本。
  • MCP 服务器接入:提供标准 MCP Server,支持 Claude Desktop、Cursor、VS Code 等 Agent 直接调用绘图能力。

技术亮点:
内置多 Provider 支持(AWS Bedrock、OpenAI、Anthropic、Google、DeepSeek、Ollama 等),通过 Vercel AI SDK 统一接口;提供 Wasm 浏览器 demo,支持服务器端多模型配置与管理员面板。

今日洞察#

GPT-5.6 的医疗数据引发了一个值得注意的转变:医生在检查 AI 回答时,发现的缺陷数量竟然少于人类同行自己写的回答。这个结果并非说 AI 比医生更懂医学——而是预设了 AI 的回答需要经过人类审查。它的真实含义是:在 20,000 次独立评分中,人类审查者更频繁地挑出同类的错误,却更少地挑出 AI 的错误。这反过来揭示了人类实践中的变异度本身就很高——不是 AI 变强了,而是人类一致性标准暴露了缺口。如果这种检查模式从“AI+审核”变成“AI 辅助审核”,那么临床医生的角色会从决策者变成验证者,而这会改变整个临床工作流的角色定义。

Mira Murati 的 Thinking Machines 宣言提出了一个与当前主流叙事相反的假设:好的未来不是一个超级智能,而是一群互相争执的 AI。这与其说是技术路线,不如说是对当前生态权力结构的另一种想象。如果多家实验室都沿这条路线走——而非归约到单一模型——那么产品设计的重心会从“模型能力上限”转向“模型差异化管理”,评测也会从单点 benchmark 转向交互场景中的分歧分析。这还远远不是落地信号,但它暗示了另一种可能被忽视的基础设施需求:多模型间的仲裁和冲突管理机制。

美团开源 LongCat-2.0 和智谱内部信的重点,表面上是技术发布和战略表态,但它们共同指向一个更具体的约束:竞争焦点已经从“谁能做 agent”转移到了“谁跑得便宜、谁能无人值守”。LongCat-2.0 选择在国产算力集群上完成万亿参数训练,这件事本身意味着他们接受了非最优硬件条件下的工程适配做代价。而智谱明确放弃短期变现,把资源押在长程任务、自治 Agent、自我进化上——这些方向在海外也还没有被彻底解决。两家国内团队的动作不是巧合,它们指向同一个判断:模型能力的差距在缩小,下一阶段的竞争将取决于谁能在 Agent 执行阶段控制成本和稳定性。

2,740 字
晚报 | EVENING 2026-07-12

🌙 AI Daily 晚报 | 2026-07-12


title: “苹果起诉OpenAI窃密,GPT-5.6证明50年未解图猜想” lead: “苹果起诉OpenAI系统性窃取商业机密,涉及超400名前员工;GPT-5.6 Sol Ultra一小时内证明循环双覆盖猜想;可灵AI完成近30亿美元融资,估值达母公司80%;NVIDIA RTX Spark真机落地Bilibili World,笔记本可跑120B参数模型。” highlights:

  • “苹果起诉OpenAI窃取商业机密,涉及400名前员工”
  • “GPT-5.6 Sol Ultra一小时内证明50年未解图论猜想”
  • “可灵AI完成近30亿美元融资,估值180亿美元”

1️⃣ [持续跟踪] 苹果诉OpenAI窃密案:超400名前员工涉案,作案细节曝光#

  • 前情提要:昨日苹果在加州北区法院正式起诉OpenAI及其硬件负责人Tang Tan,指控其系统性窃取商业机密用于AI硬件开发。
  • 最新突破:今日法律文件与社区讨论披露更多细节。苹果在诉状中指出,已有超过400名前苹果员工目前在OpenAI工作。作案手法包括:面试时要求候选人携带“真实零件”和“原型”演示;离职员工利用漏洞下载数千页机密文件;OpenAI指导离职员工规避苹果离职审查,谎称获得授权使用专属金属抛光工艺。苹果称这只是“冰山一角”。
  • 行业影响:观察人士指出此案可能直接威胁OpenAI的硬件产品线与供应链计划,对其潜在的IPO进程产生实质性冲击。社区评论称,这是自Waymo诉Uber以来硅谷最严重的商业秘密诉讼,应被视为所有使用OpenAI模型的企业客户的重大警告信号。 🔗 苹果起诉书原文 | HackerNews讨论 | 评论分析

2️⃣ [持续跟踪] GPT-5.6 Sol Ultra一小时完成50年未解图论证明#

  • 前情提要:OpenAI发布GPT-5.6系列模型,Sol在多项基准上登顶。
  • 最新突破:Greg Brockman披露,GPT-5.6 Sol Ultra在不到一小时内使用64个子Agent并行工作,完成了图论中50年未解的循环双覆盖猜想的证明。证明由Sol Ultra自动生成,作者仅负责整理。核心思路是将问题归约为无环三次图,利用8-流定理和对偶线性代数构造满足条件的边分配P_e。
  • 行业意义:这一突破被Marc Andreessen评价为“Amazing!”。它展示了LLM在尖端数学研究中的潜力,但也引发社区关于模型逻辑严谨性和幻觉风险的讨论。多数学者认为这属于“类似人类的创造性探索”,仍需人工审核确认。 🔗 Greg Brockman推文 | 完整证明PDF | HackerNews讨论

3️⃣ 可灵AI完成近30亿美元融资,估值180亿,对赌五年内上市#

  • 核心发布:快手旗下可灵AI宣布完成总额上限30亿美元的外部增资,已签约近28亿美元,创全球视频大模型单轮最高融资纪录。投后估值180亿美元,约为当天快手母公司估值的80%。
  • 融资细节:腾讯、阿里、百度罕见同时进场,华策影视、芒果系厚为资本等文娱机构亦参投。融资设置对赌条款:若可灵未能在2031年10月30日前完成IPO,投资人有权要求按单利8%年利率回购。
  • 市场格局:国产视频模型三强争霸赛中,字节Seedance占据超80%市场份额,可灵AI约14%,HappyHorse不足1%。但可灵AI在B端和有海外市场心智优势,约70%收入来自海外,2026年Q1营收超6.5亿元,同比增长超300%。
  • 行业意义:视频模型领域仍是巨头游戏,本轮融资验证了头部模型公司从母体剥离独立上市的模式。腾讯套现快手126亿港元后认购可灵,显式“清场”旧生态布局卡位AI赛道。 🔗 创业邦报道

4️⃣ NVIDIA RTX Spark真机落地Bilibili World,笔记本跑120B参数大模型#

  • 核心发布:NVIDIA在ComputeX发布的“超级芯片”RTX Spark真机现身Bilibili World展会。该芯片将CPU和GPU直接封装在一起,展示时在笔记本上成功运行120B参数的稠密大模型。
  • 技术细节:通过高带宽直连内存架构,RTX Spark可在低功耗移动端设备上实现此前需要服务器级硬件才能完成的大模型推理。现场演示中,模型推理速度流畅,覆盖文本生成、代码编写等多场景。
  • 行业意义:这是AI硬件民主化的重要一步。120B参数模型此前仅在云端和高端工作站可用,RTX Spark实现了本地化运行,有望推动个人AI应用和边缘Agent的爆发。对于隐私敏感行业(如医疗、金融)尤为重要。 🔗 量子位报道

5️⃣ 剑桥报告:博科圣地制度化使用ChatGPT等前沿AI#

  • 核心发布:剑桥AI科学与政策项目(CASPC)发布报告,通过对27名前博科圣地成员的访谈,揭露该组织两派自2024年起系统使用ChatGPT、Claude、Gemini、Grok、DeepSeek等前沿AI辅助作战与日常运作。使用已通过专门小组和内部培训制度化,覆盖攻击策划、武器故障排除和爆炸装置设计。
  • 具体案例:训练成员用AI学习如何跳沟飞驰——挖坑填玻璃和火焰练习,18人训练中死亡但8人成功,在后续攻击中实施。受访者对AI表现出强烈热情,部分对大规模杀伤性武器持开放态度,并成功绕过了部分安全防护。
  • 行业意义:这是迄今为止最详实的恐怖组织AI使用实证报告,表明恐怖分子对AI的采用“比先前认知更深入、更系统”,已成为当前且不断增长的现实威胁。报告呼吁政策制定者、安全界和AI开发者共同重视。 🔗 CASPC报告原文 | HackerNews讨论

6️⃣ 纽约市10月起禁止欺骗性订阅,要求含税标价#

  • 核心发布:纽约市消费者保护办公室宣布两项新规:10月1日起禁止企业利用欺骗性订阅手段将用户锁入重复收费陷阱,违规者面临每名用户525美元罚款。同时拟出台“垃圾费用”规则,要求卖家在广告中提前标明含所有强制附加费的总价,影响酒店、租车公司等面向游客的企业。
  • 影响预测:订阅规则预计每年为纽约市民节省1.625亿美元。此前联邦层面的“一键取消”规则在2025年被联邦法官驳回,纽约市此举被视为从地方层面推动消费者权益保护。
  • 行业意义:AI订阅服务的定价模式和自动续费机制在AI行业普遍存在,该规则可能影响ChatGPT、Claude、Copilot等产品的订阅设计,特别是自动续费和取消流程的设计。 🔗 Guardian报道 | HackerNews讨论

7️⃣ LWN遭最严重爬虫攻击,AI爬虫军备竞赛升级#

  • 核心发布:LWN.net发布更新文章,揭露AI爬虫机器人攻击持续恶化。攻击流量大量来自住宅代理网络——通过恶意软件或“免费VPN”劫持普通用户设备,从数百万个IP发起请求,每个IP仅访问一两次,传统封禁手段无效。幕后付费方身份不明,可能包括秘密政府机构、犯罪组织和模型开发者。
  • 防御现状:网站运营者不得不使用工作量证明(如Anubis)、人机验证、登录墙或数据毒化工具。LWN本身经历了有史以来最严重的爬虫攻击,但由于已实施的防御措施多数读者未察觉。
  • 行业意义:AI数据源的获取越来越依赖于爬取公开网站内容,住宅代理网络的普遍化使得网站所有者面临前所未有的保护压力。这场军备竞赛正迫使中小网站选择关门或被爬虫耗尽资源,直接影响AI训练数据的质量和多样性。 🔗 LWN文章 | HackerNews讨论

8️⃣ Ghost字体:人类可读但AI无法识别的反爬虫字体#

  • 核心发布:开发者发布Ghost Font,一种通过动态点阵与运动噪声使人类可读、但AI无法从单帧识别的字体。结合运动、噪声和诱饵消息,实验显示GPT-Sol 5.6 Ultra和Claude Fable等最先进模型常误读诱饵消息而忽略真实信息。
  • 设计原理:该字体在视频中通过点阵运动显示文字,人类肉眼可识别,但截图或单帧图像无法识别。项目借鉴2013年ZXX字体的理念(已被AI破解),利用视频动态和诱饵层增加难度。
  • 行业意义:这代表了反AI识别技术的新方向。在CAPTCHA逐渐被AI攻破(Google的CAPTCHA实际已基于鼠标轨迹等启发式判定),新的视觉对抗方法正在兴起。Ghost字体可能被用于验证码、AI视觉基准测试,或作为内容保护工具。 🔗 Ghost Font官网 | HackerNews讨论

9️⃣ 工具与生态:sqlite-utils 4.1、Cloudflare修复hyper漏洞#

  • sqlite-utils 4.1发布:Simon Willison发布sqlite-utils 4.1,新增--code选项支持插入Python代码生成的rows,--type选项覆盖CSV/TSV列类型(如邮编存为TEXT保留前导零),新增drop-index命令、table.transform(strict=)切换Strict模式。部分功能由GPT-5.6 Codex辅助实现,展示AI辅助编程在日常工具开发中的实用性。 🔗 Simon Willison博客

  • Cloudflare修复hyper HTTP/1竞争条件bug:Cloudflare披露其在广泛使用的Rust HTTP库hyper中发现并修复了一个罕见bug,该bug可能在高负载下静默截断大HTTP响应但仍返回200 OK状态码。漏洞已存在多年,仅在特定时序条件下触发,已在上游修复。 🔗 InfoQ报道