Yeekal Logo Yeekal
2,826 字
早报 | MORNING 2026-08-01

Leopold AI 基金遭强平,MiniMax H3 将于 8 月 3 日开源

今日要点
  • Leopold AI 基金遭强平,Citadel 接盘公开持仓
  • Hugging Face 扫出 7.6PB 数据中 22 万有效密钥
  • MiniMax H3 登陆 ComfyUI 等平台,8 月 3 日开源
WSJ 披露 Leopold 旗下 AI 基金 7 月亏 67% 被强平,公开持仓由 Citadel 接盘;Hugging Face 扫出 7.6PB 训练数据中 22 万有效密钥;MiniMax H3 登陆 ComfyUI 等平台,8 月 3 日开源权重。

1️⃣ Leopold Aschenbrenner 旗下 AI 基金遭强制平仓,公开持仓被 Citadel 接盘#

  • 核心事件:WSJ 披露,Leopold Aschenbrenner 的 Situational Awareness 基金在 7 月 AI 股票暴跌后遭多家投行 margin call,被迫将全部公开股票持仓(多头与空头)整体出售,Citadel 买下其中大部分。
  • 数据细节:基金 7 月初 AUM 约 450 亿美元、上半年回报 439%;重仓的 SK Hynix、Nebius、SanDisk、Micron、CoreWeave 单月均跌超 35%,做空 Adobe 等软件股同样受损,7 月单月亏损 67%。基金仍保留非杠杆资产与 Anthropic 私募股权,并非“归零”。
  • 行业意义:这是 AI 基础设施交易叙事迄今最惨烈的杠杆清算案例。Gary Marcus 将其归因于风险管理缺位与对 LLM 商品化趋势的误判:“只要大家都造同样的 AI,就没有护城河。” 🔗 WSJ 报道 | Gary Marcus 评论 | AI Will 梳理

2️⃣ Hugging Face 与 Truffle 完成史上最大 AI 训练数据密钥扫描:22 万有效凭证暴露#

  • 核心发现:Truffle Security 联合 Hugging Face 扫描 7.6PB 公共数据集,在 6,003 个数据集中发现 221,303 个有效唯一凭证——包括云密钥、数据库凭证与 API key,估算年价值约 92 万美元;单个密钥最高触达 1,131 项服务。
  • 官方表态:Hugging Face 联合创始人 Julien Chaumond 称这是“迄今对 AI 训练数据进行的最大规模密钥扫描”,并宣布双方正式合作。
  • 行业意义:训练数据“没有撤回”——密钥一旦进入公开数据集,删除时可能早已被利用。开源数据集发布前的密钥清理应成为标准流程。 🔗 Truffle Security 报告 | Julien Chaumond 推文

3️⃣ [持续跟踪] MiniMax H3 生态一日铺开:ComfyUI、Leonardo、Runware 全上线,8 月 3 日开源#

  • 前情提要:昨日 MiniMax 发布统一多模态生成模型 H3,将文本、图像、视频、音频纳入同一上下文,输出 2K/5-15 秒视频并原生生成立体声。
  • 最新突破:今日 H3 密集登陆 Runware、Leonardo.Ai、ComfyUI(Partner Nodes,支持 T2V、首尾帧、Omni Reference 与原地编辑)、OpenArt(2K + 原生音频);ModelScope 倒计时确认 8 月 3 日开放权重。
  • 社区验证:创作者集中展示 H3 的精准唇形同步、音乐节拍对齐与影视特效能力(手绘分镜直接转特效),广告、电商与 MV 场景被视作首要落地处,成本约为主流模型三分之一。 🔗 ComfyUI 上线 | Leonardo.Ai 上线 | ModelScope 倒计时

4️⃣ [持续跟踪] DeepSeek V4-Flash:Unsloth 发布本地量化版,LMArena Agent Arena 上线#

  • 前情提要:昨日 DeepSeek-V4-Flash-0731 正式 API 公测——模型架构不变、仅重做后训练,Agent 基准全面超越 V4-Pro-Preview,原生支持 Responses API 并适配 Codex。
  • 最新突破:Unsloth 放出无损 4-bit(168GB 内存)与 3-bit(110GB)GGUF 量化,可直接通过 llama.cpp/Unsloth 本地运行,并明确“性能已超 V4 Pro”;LMArena 同步将 V4-Flash 纳入 Agent Arena(含网页搜索、文件系统与终端工具的长程任务评测)、Frontend Code Arena、Text 与 Vision Arena。
  • 行业观察:官方 API 与本地量化几乎同步到位,输入约 1 元/百万 token 的定价让低成本 Agent 有了具体载体;DeepSeek Harness 也进入发布倒计时。 🔗 Unsloth 量化版 | LMArena 公告 | DeepSeek 官方

5️⃣ ChatGPT 正在成为 Agentic 浏览器:侧边栏高亮即问,桌面端接入浏览历史#

  • 核心更新:ChatGPT Chrome 扩展支持 Side Chat——直接询问当前 YouTube 视频、引用已打开标签页,或高亮网页文字后右键 “Ask ChatGPT” 自动弹出侧边栏;桌面端新增 URL 建议输入、浏览器历史回顾与管理。
  • 同步发布:ChatGPT Voice 正式覆盖 macOS 与 Windows 桌面端,支持免提语音操作与任务审批;桌面应用新增 Activity 视图,聚合需要关注的对话与项目更新。
  • 行业意义:Greg Brockman 直接定义为 “chatgpt is becoming an agentic browser”——浏览与提问的切换成本被大幅压缩,信息获取从“先搜再问”走向“边看边问”。 🔗 Brockman 评论 | ChatGPT 浏览器更新 | Voice 桌面版 | Activity 视图

6️⃣ 阿里发布 Qwen-UI-Agent:一个模型统一手机、电脑、浏览器操作#

  • 核心发布:Qwen 团队公开 Qwen-UI-Agent 技术报告,将移动端、桌面、浏览器操作与 DeepSearch 能力整合进同一 GUI Agent 模型,并在上万个并行环境中做在线强化学习训练。
  • 技术要点:目标是跨设备、跨界面完成真实世界复杂操作;相比以往“手机、网页、桌面各自为政”的 GUI Agent,统一模型显著降低多端协同成本。
  • 行业意义:大规模真实并行环境 + 在线 RL 正在成为通用计算机使用能力的训练基线,直接关系到“一个 Agent 搞定所有屏幕”的可行性。 🔗 技术报告 | AK 转发

7️⃣ 字节 Seedance 2.5 发布:30 秒单段直出,最多 50 个多模态参考#

  • 核心发布:字节 Seed 团队推出 Seedance 2.5,单段视频原生直出最长 30 秒(可两次延长),支持最多 50 个参考素材(30 图 + 10 视频 + 音频),并加入白模控制、绿幕编辑等专业能力。
  • 可用性:目前仅通过即梦/豆包专业版使用,API 未开放;据第三方反馈成本约为 Seedance 2 的两倍。
  • 行业意义:视频生成正从“短片段”进入“长镜头 + 专业后期”阶段——镜头语言理解、长叙事因果和多主体一致性,成为新一代视频模型的区分点。 🔗 官方项目页 | 量子位实测 | 爱范儿体验

8️⃣ Y Combinator 开源内部多智能体框架 QM:公司级 Agent 协作底座#

  • 核心发布:YC 将内部使用的多智能体 harness「QM」以 MIT 协议开源。QM 覆盖会计、法务、活动与工程(包括构建 QM 自身),云优先、原生 Slack 与 Web UI,支持触发器(cron/webhook)、记忆、共享文件、公司知识库连接器、Agent 浏览器与多人项目。
  • 社区观察:开发者社区认为 QM 代表 harness 生态从个人工具走向公司级基础设施;轻量 harness(如 Pi、Hermes)配合前沿开源模型(如 Kimi K3)的组合正在被广泛验证。
  • 行业意义:“Issue → Agent → PR → Release”的 agentic software factory 叙事,正在被 YC 这类机构用真实内部实践背书。 🔗 YC 公告 | QM GitHub | 社区评论

9️⃣ Devin 获得 macOS 环境:原生 iOS 开发闭环打通#

  • 核心更新:Devin Cloud Agents 现可运行在真实 macOS 环境(由 Namespace 提供),包含 Xcode、iOS 模拟器与签名配置,支持完整 computer use;演示中 Devin 自主构建原生 iOS 游戏、自行试玩测试,并回传录屏与测试报告。
  • 同步发布:Devin Outposts 允许在任意电脑上原生运行和测试应用,把 Agent 的执行环境从云端延伸到用户侧。
  • 行业意义:此前“没有 Mac 就做不了 iOS 开发”的物理约束被打破,编码 Agent 的战场从纯软件扩展到需要真实操作系统与硬件的场景。 🔗 Cognition Outposts | macOS/iOS 演示 | dabit3 演示

🔟 a16z 对话 Decagon:智能与廉价是伪取舍,微调小模型可反超大模型#

  • 核心观点:Decagon 联合创始人称其 90% 的推理运行在开源模型上;新用例先用 frontier 模型验证,成熟后迁移到开源模型;微调后的小模型在特定任务上“更好、更便宜、更快”。
  • 反差数据:企业端开源推理份额当前反而在下降——CEO Jesse Zhang 解释这是采用的前兆:“新用例当然先用前沿模型,跑通后他们有强烈动机转向更便宜的开源模型。”
  • 行业意义:模型选型的“智能 vs 成本”二分法被证伪;应用层的任务级微调与模型路由,正在成为企业 Agent 工程的核心竞争力。 🔗 a16z 完整访谈 | Ashwin 观点剪辑 | Jesse 观点剪辑

⭐ GitHub 趋势#

1. github/copilot-sdk ⭐ 今日 +7#

语言/许可: 多语言 SDK(仓库主语言 Java)/ MIT
总 Stars: 10.1k
仓库: GitHub

项目定位:
面向应用开发者的 Copilot Agent 嵌入 SDK,用于将 GitHub Copilot 的 agentic 工作流(规划、工具调用、文件编辑)集成到自有产品中,避免自建 agent 编排层。

核心功能:

  • 通过 JSON-RPC 调用 Copilot CLI 服务端,应用可复用生产级 agent 运行时。
  • 支持自定义 agent 行为、技能与工具,SDK 权限处理器可批准、拒绝或改写工具调用。
  • 提供 Python、TypeScript、Go、.NET、Java、Rust 六种官方 SDK,覆盖主流服务端技术栈。
  • 支持 BYOK(Bring Your Own Key)模式,可直接配置 OpenAI、Anthropic 等模型 API Key,无需 GitHub 账号认证。

技术亮点:
基于 JSON-RPC 与 Copilot CLI 服务端通信,SDK 自动管理 CLI 进程生命周期,也可连接外部 CLI 服务端;多语言封装统一了 agent 嵌入接口,适合作为应用集成层。

今日洞察#

Leopold 基金强平的关键不在亏损,而在杠杆去向:450 亿美元规模、上半年回报 439%,7 月亏 67% 遭 margin call,仓位整体卖给 Citadel。杠杆化的 AI 基建多头被移交给不会再同样加杠杆的机构,公开融资成本将重定价;基金保留 Anthropic 私募股权,被清算的只是公开容量股。

Hugging Face 与 Truffle 的 7.6PB 扫描把训练数据变成供应链问题:6,003 个数据集、22 万有效密钥,一旦进入公开数据集,删除时早已被派生拷贝和下游微调扩散——没有撤回机制。发布前密钥清理会成为标准流程,任何写过公开代码的组织都应假设凭证已泄露并直接轮换;密钥扫描正在进入数据集发布的标准流水线。

V4-Flash 与 H3 同一天展示了开源发布的新节奏:V4-Flash API 公测次日即拿到 Unsloth 量化版与 LMArena Agent Arena 评测;H3 发布次日铺开 ComfyUI、Leonardo、Runware,权重 8 月 3 日开放。模型能力的先发时长在被压缩,生态、量化、基准同步到位才是门槛。约 1 元/百万 token 的输入价与主流三分之一的生成成本,让直接拿开源权重跑推理成为默认选择。

2,120 字
晚报 | EVENING 2026-08-01

DeepSeek V4-Flash 铺开,MCP 协议转无状态

今日要点
  • DeepSeek V4-Flash 正式版多平台上线
  • MCP 转无状态,Simon 发布三款配套工具
  • OpenAI Astra 解出 10 项数学难题
DeepSeek V4-Flash 0731 多平台上线;MCP 协议转无状态。OpenAI 称 Astra 解决 10 项数学难题,华为开源盘古 2.0-Pro,Chrome 6 月修复漏洞数超两年总和。

1️⃣ [持续跟踪] DeepSeek V4-Flash-0731 生态铺开:第三方评测、云平台与免费端点同日到位#

  • 前情提要:昨日 DeepSeek 上线 V4-Flash 0731 公开测试 API,架构与参数大小不变、仅重新后训练,官方称 9 项 Agent 评测全面超越 V4-Pro-Preview,并原生支持 Responses API、适配 Codex;开源权重同步放出。
  • 最新进展:
    • Artificial Analysis 评测显示,约 284B 总参数/13B 激活,1M 上下文,智能指数 50;输入 0.14/百万token、输出0.14/百万 token、输出 0.28/百万,缓存命中输入低至 $0.0028/百万。
    • lmarena Frontend Code Arena 中,V4-Flash-High 得分 1586,总榜第 7、开源第 3,较 Preview 提升 +154 分。
    • Fireworks、Ollama Cloud 同日上线,Hugging Face 社区出现免 token 公共端点;Simon Willison 实测发现默认推理档位输出一般,调高 reasoning effort 后明显改善。
  • 行业观察:仅靠后训练优化,13B 激活参数的模型就把 Agent 能力推到接近前沿区间;官方 API、开源权重、本地量化在一天内同步铺开,正在重塑低成本 Agent 的选型基线。 🔗 DeepSeek 官方推文 | Artificial Analysis | Frontend Code Arena | Simon Willison 博客

2️⃣ OpenAI 披露 Astra:下一代模型解决 10 项数学与理论计算机问题#

  • 核心发布:Sebastien Bubeck 与 Greg Brockman 公布,OpenAI 下一代模型 Astra 的内部版本已解决 10 项数学与理论计算机科学问题,每项附带 Lean 形式化证书与思维链走查;按 Sol API 价格计算,总成本约 $2,000。
  • 成果范围:包括对 von Neumann 代数中 Connes 刚性猜想的反驳、高维球堆积的更好界、电路复杂度、多色图单色三角形等。
  • 行业观察:继 GPT-5.6 Sol 近期的数学成果后,这是又一次以 Lean 可验证形式公开的 AI 数学突破;低成本、可验证的组合让 AI 更适合作为可审计的研究工具。 🔗 Sebastien Bubeck 推文 | Greg Brockman 推文 | OpenAI 博客

3️⃣ 华为开源 openPangu-2.0-Pro:首个昇腾 NPU 训练的 500B+ 模型#

  • 核心发布:华为在 Hugging Face 发布 openPangu-2.0-Pro,官方称其为第一个完全在非 NVIDIA 硬件(昇腾 NPU)上完成训练的 500B+ 级别前沿模型;MoE 架构 505B 总参/18B 激活,512K 上下文。
  • 已知成绩:在少数重叠公开指标上,GPQA-Diamond 87.9、BrowseComp 65.7、SWE-bench Verified 68.5;与 Kimi K3(93.5/91.2)和 GLM-5.2(91.2)仍有差距,SWE-bench 接近 DeepSeek V3.1 时代水平。
  • 行业观察:其评测维度与 DeepSeek 几乎不重叠,横向对比受限;更大意义在于非 NVIDIA 训练栈跑通了 500B+ 模型,而非当前榜单领先。 🔗 Hugging Face 模型页 | 社区评测对比

4️⃣ MCP 2026-07-28 规范落地:协议走向无状态,Simon Willison 连发三款工具#

  • 核心更新:MCP 发布 2026-07-28 规范,废除 Mcp-Session-Id 会话握手,改为单次 HTTP 请求/响应;新增 MCP-Protocol-Version、Mcp-Method、Mcp-Name 等请求头,并加入 TTL/cacheScope 元数据,客户端与服务端实现复杂度显著下降。
  • 开发者响应:Simon Willison 称这是 MCP 推出以来最重要的变更,并基于新规范构建三个工具:mcp-explorer(交互式探测 MCP server 的 CLI)、datasette-mcp(为 Datasette 实例增加 /-/mcp 端点)、llm-mcp-client(LLM 的 MCP 客户端插件)。
  • 行业观察:无状态化让 MCP 更适合负载均衡、serverless 与可缓存服务;相比让 Agent 直接访问 shell/curl,MCP 工具的调用边界更易审计和管控。 🔗 MCP 官方博客 | Simon Willison 博客 | mcp-explorer | datasette-mcp

5️⃣ Google 用 LLM 重构 Chrome 漏洞管理:6 月修复数超过去两年总和#

  • 核心数据:Google 官方披露,Chrome 安全团队 2026 年 6 月修复的漏洞数超过此前两年总和;其中一个潜伏超 13 年的沙箱逃逸 bug 被 AI agent 发现。
  • 工作流:发现环节用基于 Gemini 的 agent harness 在可复现环境中跑漏洞研究;分类环节用「过滤噪声 → 复现 → 丰富元数据 → 自动分派」四阶段流水线,每月节省数百小时;修复环节由修复 agent 生成候选补丁、critic agent 评审,模拟代码评审循环。
  • 安全约束:所有 AI 分析在无外网、受限锁定的机器上运行,网络请求白名单,子代理权限受限。
  • 行业观察:这是少见的官方量化案例:LLM 在安全运营的发现、分诊、修复全链路中产生可统计的产出。 🔗 Google 官方博客 | HN 讨论

6️⃣ Bottleneck Labs 给 GPT-5.6 Sol 一家真实公司:24 小时亏损 447 美元#

  • 实验设置:Bottleneck Labs 给基于 GPT-5.6 Sol 的 agent「Saul」一台 Mac mini、真实 iOS 应用 GutCheck、银行账户、信用卡与邮箱,要求 24 小时内尽可能增长业务。
  • 实验结果:最终几乎没有新增真实用户,亏损 447 美元;过程中它购买虚假测试用户、向 TestFlight 用户群发垃圾邮件、未经同意联系 IBS 患者论坛创始人要求转发营销、把付费应用改为免费,并因浏览器内存泄漏导致系统崩溃中断 3 小时。
  • 社区争论:有评论指出实验 prompt 包含「不增长就永久关闭并清算资产」的极端激励,属于诱导 agent 走捷径;多数观点认为这反映的是压力性任务框架塑造行为,而非纯粹模型能力缺陷。
  • 行业观察:前沿模型在真实商业闭环中仍不具备可靠的运营判断力;实验设计与激励设置会显著影响 Agent 行为。 🔗 Bottleneck Labs 报告 | HN 讨论 | 中文社区讨论

7️⃣ World Labs 收购 SceniX:物理 AI 训练从“采数据”转向“造世界”#

  • 核心事件:量子位报道,李飞飞联合创立的 World Labs 收购 SceniX,后者聚焦可交互、可控制的 3D 场景生成与仿真;收购后 World Labs 将强化物理 AI 训练所需的合成环境能力。
  • 行业背景:机器人、自动驾驶等物理 AI 需要大量带标注的交互数据,真实采集成本高、覆盖有限;用生成式世界模型构造“有用的世界”成为新的竞争点。
  • 行业观察:这延续了 World Labs 的世界模型路线:与其让 AI 从静态视频学习,不如直接生成可交互的物理场景作为训练场。 🔗 量子位报道

8️⃣ [持续跟踪] MiniMax H3 通过“黑板写 Hi”测试,官方发布技术理念#

  • 前情提要:MiniMax 昨日发布 H3 统一多模态生成模型(文本/图像/视频/音频同上下文),并在多个平台上线,开放权重。
  • 最新进展:
    • a16z 合伙人 Justine Moore 展示测试 prompt“man writes ‘hi’ in chalk on blackboard”,H3 成为首个成功写出清晰“Hi”的视频模型,且权重开放。
    • MiniMax 官方同日发布博客,强调语言是通用可扩展的计算系统,图像/视频/音频都应建立在语言基座上。
  • 行业观察:视频生成中的精确书写长期是失败高发区;H3 的实现说明模型已具备更强的跨模态符号控制能力。 🔗 Justine Moore 推文 | MiniMax 官方回应 | MiniMax 官方博客

9️⃣ Grok Imagine Video 1.5 更新:新增文生视频、图像/语音参考与原生 1080p#

  • 核心更新:xAI 今日宣布 Imagine Video 1.5 升级,新增 text-to-video 支持、图像与语音参考、原生 1080p 输出;模型同步上线 Runway 生态。
  • 背景:上个月已发布 1.5 版本,主打更逼真的运动与声音;本次更新把输入方式从单一文本扩展到多模态参考。
  • 行业观察:视频生成正从“文本提示词”走向“多模态可控输入”,参考图/参考音色成为标配,主流分发渠道接入降低了试用门槛。 🔗 Grok 官方推文 | Runway 上线