Yeekal Logo Yeekal
4,122 字
早报 | MORNING 2026-08-30

腾讯开源 Hy4-preview,OpenAI 重置 Codex 额度,MiniMax 实时视频生成

今日要点
  • 腾讯开源 Hy4-preview,vLLM 首日支持 FP8 推理
  • OpenAI 重置 Codex 额度,修复 8 类 token 消耗问题
  • MiniMax H3-Max 9 秒生成 15 秒视频,接入 Twitch 直播
腾讯开源 Hy4-preview(770B/49B MoE,Apache 2.0),vLLM 首日支持 FP8 推理;OpenAI 重置 Codex 付费用户额度,修复 8 类消耗,可用时长提升 10%-50%;MiniMax H3-Max 9 秒生成 15 秒视频,接入 Twitch 直播。

1️⃣Codex 重置全部付费用户额度,修复 8 类 token 消耗问题#

  • 核心:OpenAI 为 Codex 与 ChatGPT Work 所有付费用户重置使用额度,同等额度实际可用时长提升 10% 到 50%。
  • 修复清单:上下文压缩时旧图片未清理(重度图片用户消耗降约 10%);/goal 越过停止条件导致单周 15%-70% 额度空耗;子智能体未经指令擅自调用更强模型;MCP 工具结果重复编码等。
  • 后续机制:官方已做架构层调整防止问题回归,并计划在应用内直接展示额度消耗去向。 🔗 Tibo 公告 | 宝玉解读

2️⃣[持续跟踪] MiniMax H3-Max:9 秒生成 15 秒视频,催生无限动画直播#

  • 前情提要:MiniMax 开源 H3 权重后,fal 基于其做后训练与推理优化,推出 H3-Max,速度较原模型提升约 50 倍。
  • 最新进展:开发者 @levelsio 将 H3-Max 接入 Twitch 直播流,实现“永不停播的动画频道”;MiniMax 官方转发称这是开放权重生态的自我证明。
  • 行业影响:视频生成从“分钟级等待”进入“实时生成”区间,持续直播、交互式内容等新应用形态有了基础设施支撑。 🔗 MiniMax 官方声明 | levelsio 演示 | Hailuo 转发

3️⃣[持续跟踪] OpenAI 终止 Cursor 访问,模型与 harness 分离成为焦点#

  • 前情提要:OpenAI 因 Cursor 被 SpaceX 收购触发控制权变更条款,提议 11 月 12 日终止 Cursor 对 OpenAI 模型的直接访问。
  • 最新进展:Cursor CEO Michael Truell 回应称 OpenAI 模型约占 Cursor 流量的 5%,正在与 OpenAI 协商;LangChain CEO 与多位开发者将此视为“模型与 harness 必须解耦”的案例。
  • 行业影响:模型提供方垂直整合的趋势正在重塑第三方 Agent 工具的供应链,跨模型工具链的价值被重新评估。 🔗 Cursor 回应 | Harrison Chase 评论 | elvis 观点

4️⃣[持续跟踪] 腾讯 Hy4-preview 开源,vLLM 首日支持 FP8 推理#

  • 前情提要:腾讯混元开源 Hy4-preview:770B 总参数、49B 激活的 MoE,支持 1M 上下文,Apache 2.0 许可。
  • 最新进展:vLLM 宣布 Hy4-preview 发布首日即可运行,已通过 NVIDIA GPU 验证;FP8 单命令部署:VLLM_ENABLE_HPC_OPS=1 vllm serve tencent/Hy4-preview-FP8 -tp 8。
  • 架构细节:256 个路由专家加 1 个共享专家;每次查询只关注 2048 个 token;78 层中仅 21 层计算自己的稀疏索引;checkpoint 内置 10B MTP 层,活性 0.7B,草稿深度 3。
  • 意义:顶级开源 MoE 的部署成本被进一步压低,端到端推理方案成为开源模型竞争的新战场。 🔗 腾讯混元推文 | vLLM 集成说明

5️⃣Claude Code 周额度变更:9/14 起永久提升 25%#

  • 官方口径:9 月 14 日起,Pro、Max、Team 与 Enterprise 的 Claude Code 标准周限额将永久提高 25%;此前的临时 50% 增幅只持续到该日期。
  • 净效应:对比当前临时窗口,用户实际可用额度将减少约 17%,但此后不再有临时调整的不确定性。
  • 影响:额度从“临时加赠”转向“永久基线”,重度用户的成本规划更明确,但短期感知仍是收紧。 🔗 ClaudeDevs 公告 | 宝玉量化分析 | 社区换算

6️⃣马斯克:2027 年约 15GW AI 算力无法按时通电#

  • 核心判断:基于共识估计,2027 年生产的 AI 算力中约有 15GW 当年无法接入电网启用,缺口来自电力之外的全链条配套。
  • 卡点拆解:变压器、线缆、液冷管路、大型冷水机组与复杂网络建设都需要同步到位,而不仅仅是找到电源。
  • 影响:GPU 供给若持续跑在配套基建前面,算力利用率和推理定价都可能被进一步推高。 🔗 马斯克推文

7️⃣MIT 实验:不通信的 AI agent 群体自发分工,并留下超越创建者的技术#

  • 实验设计:数百个初始相同的 agent 被放入一个可永久修改的世界,无预设角色、无直接通信,仅通过环境进行协调。
  • 涌现现象:agent 自发分化出探索者、建造者、照料者与协调者;76% 的产物由多个 agent 协作完成,最深的技术谱系超过 12 个 fork。
  • 关键数据:约 95% 的首次技术复用来自对环境中已有物件的观察,而非发明者的直接交接;移除全部 agent 后,其建造的技术仍能承受未知扰动继续运行。
  • 安全含义:agent 可以通过持久化环境进行长时协调,这暴露了只监控 agent 间通信的评估盲区。 🔗 MIT 教授推文 | elvis 转述

8️⃣Notion 把 Agent 搬进工作流:Custom Agents API 公测 + 8 项 AI 更新#

  • API 公测:Custom Agents API 进入公开测试,agent 可被接入 Slack bot、内部仪表盘和外部客服流程。
  • Agent 一等公民化:页面可以像分享给同事一样分享给自定义 agent;AI Meeting Notes 完成后可自动触发 agent;通过对话可直接生成可复用 Skill。
  • 新增控制:Effort 控制允许用户设定 AI“思考强度”;AI 用量视图可查看配额花在哪;模型选择器按提供方分组并支持收藏。 🔗 Notion 功能帖 | Custom Agents API 公告 | AI Usage 视图

9️⃣企业 AI agent 进入务实期:马士基 200+ 实例、Box 上线即重建#

  • 核心判断:AI Engineer World‘s Fair 的 AI-Native 企业专场提出,“agent loop 不是系统,系统在 loop 周围”。
  • 一线数据:马士基运行 200+ agent 实例,质量提升来自 9 个月内 10 万次专家修正而非更大模型;Box 的 agentic 搜索周二上线、周三开始重建,agent 基础设施半衰期以月计;Millennium 采购流程约 5% demo 转化率,试点周期从半年缩短到两周。
  • 信号:企业 agent 落地的差距正从“模型质量”转移到“工程与维护机制”。 🔗 AI Engineer 直播 | 五条事实总结

🔟Apple 提出 Agent Seer:从 MCP 规范自动合成 agent 评测集#

  • 创新点:仅凭一个 MCP server 规范,无需示例、无需真实工具调用,即可生成多轮 agent 测试场景——函数名、自然语言描述和参数 schema 已携带足够语义。
  • 评测发现:参数 schema 的复杂度比工具集大小更能预测质量差异;参数值准确性是最主要的失败维度,这无法被粗粒度的名称匹配型工具调用指标捕捉。
  • 应用前景:MCP 规范更新后可直接生成回归测试,缓解手工基准随 API 变更而过时的问题。 🔗 论文地址 | elvis 书评

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
THU-MAIC/OpenMAICAI Agent / 教育22.2k
workweaver/routerAI Infra / 模型路由2.7k
addyosmani/agent-skillsAgent 工程 / 工具链90.7k

1. THU-MAIC/OpenMAIC ⭐ 今日 +907#

语言/许可: TypeScript / MIT
总 Stars: 22.2k
仓库: GitHub

项目定位:
开源多智能体交互课堂平台,将任意主题或上传材料自动转化为由 AI 教师与 AI 同学实时互动的完整课程。解决课程制作中内容编排与互动设计的高人力成本问题。

核心功能:

  • 一键生成课程:输入主题或附件,自动产出幻灯片、测验、交互式 HTML 模拟与项目制学习(PBL)内容
  • Agent 工作台:基于持久化会话的对话式编排,可规划、构建、修订整门课程,支持取消、恢复与材料上传
  • 多智能体实时课堂:AI 教师/同学支持白板绘图、TTS 语音讲解与实时讨论
  • 开放集成与导出:导出 .pptx/离线 HTML,支持 OpenClaw 从飞书、Slack、Telegram 等消息应用触发生成

技术亮点: 基于 LangGraph 的多智能体编排,模型、搜索、存储均采用 provider-neutral 可插拔设计,并提供 @openmaic/* SDK 与 Postgres 持久化参考实现。


2. workweaver/router ⭐ 今日 +284#

语言/许可: Go / NOASSERTION
总 Stars: 2.7k
仓库: GitHub

项目定位:
面向 Agent 系统的模型路由网关,通过 OpenAI-compatible 端点自动为每个 prompt 选择最优模型。解决 Agent 工作负载中“全流量使用顶级模型”造成的成本与延迟浪费。

核心功能:

  • 单次路由决策延迟 <50ms
  • 宣称可削减 40-70% 推理成本
  • 兼容 OpenAI API,仅需修改 base_url 即可接入
  • 针对 Claude Code、Codex 等 agentic coding 工具场景优化

技术亮点: Go 实现,以低延迟路由层嵌入现有 agent 工作流,对客户端透明。


3. addyosmani/agent-skills ⭐ 今日 +196#

语言/许可: JavaScript / MIT
总 Stars: 90.7k
仓库: GitHub

项目定位:
面向 AI 编程代理的生产级“技能”包,将资深工程师的工作流、质量门禁与最佳实践编码为可复用的 Markdown 工作流。解决 AI agent 在真实项目中流程缺失、质量不稳定的问题。

核心功能:

  • 25 个技能覆盖 define / plan / build / test / review / ship 全生命周期
  • 9 个斜杠命令(/spec、/build、/review 等)按阶段自动激活对应技能
  • 通过 skills CLI 可安装到 70+ agent(Claude Code、Cursor、Codex、Copilot、Gemini CLI)
  • 每个技能内置验证门禁与 anti-rationalization 表,强调测试驱动与增量交付

技术亮点: 纯 Markdown 技能格式配合 vercel-labs/skills 生态,实现了跨主流 agent 工具的可移植安装与自动发现机制。

🟧 Hacker News 热议#

Tencent Releases and Open-Sources Tencent Hy4 Preview#

158 pts · 97 comments · tencent.com

📌 内容总结

  • 腾讯官方发布博客,但原文抓取快照失败(仅缓存到图标),以下核心事实来自 HN 讨论中引用/转述的博客内容
  • HN 关注点:
    • Hy4 规格:770B 总参数 / 49B 激活参数的 MoE 模型,上下文窗口超 1M tokens,Apache 2.0 许可证
    • OpenRouter 上线数天即处理数万亿 tokens,超过 GLM 5.3 一周的量;cache 读取定价 5%,低于常见的 10%/20%
    • 官方称 Hy4 首次参与自身开发流程:自动化优化训练方法、数据策略、评估框架与底层算子,形成早期递归自我改进循环

💬 讨论总结

  • 商业现实:OpenRouter 的高用量被质疑为厂商付费买曝光;有评论专门分析过 cache read 成本是推理账单中常被隐藏的大头,认为 5% 定价才是真正竞争力,且 <$0.01/MTok 的 cache 读取市场存在空白
  • 用户实测(Hy3):作为通用 agent 模型仅次于 deepseek4-flash,行为与 DeepSeek 高度接近,被怀疑是 fork;preview 到正式版存在”不可用→可竞争”的跃升;速度是普遍短板
  • 开源语义之争:open weights 被贬为”可在本地运行的二进制 blob”,不构成开源;反驳称 Apache 2.0 允许微调/继续训练,模型本质是”有损压缩的数据集”
  • 对”递归自我改进”的解读:有评论联系 ai-2027 预测,认为中国已无需窃取权重;也有评论将此类预测斥为无依据的”tech bro 酒后猜测”,实际追赶路径更可能是蒸馏
  • 风险/限制:官方图表柱高与数值不符,疑似 AI 生成;实际 benchmark 请求频繁超时/限流,provider 不可用
  • 地缘政治情绪:个别评论欢呼中国开源打破美国双寡头垄断,被反驳为空洞且无实质内容

🔗 原文 · HN 讨论页

vLLM v0.28.0#

87 pts · 30 comments · github.com/vllm-project

📌 内容总结

  • vLLM 0.28.0 发布说明:584 commits / 270 contributors(76 位新贡献者)
  • HN 关注点:
    • Kimi-K3 全栈优化:Decode Context Parallel、fused FlashKDA kernel、GEMM-RS 序列并行、1.5–3x kernel 级加速、自适应 speculative token budget 提升 DSpark TTFT 约 60%、shared-expert sharding 每 GPU 省 ~17 GiB
    • DeepSeek V4:sparse MLA 端到端支持(plain decode / MTP / DSpark)、AMD Quark NVFP4、ROCm gfx11/gfx950 启用
    • 破坏性变更:bitsandbytes 移至 out-of-tree 插件、Transformers 升至 5.15.0

💬 讨论总结

  • 稳定性是主要抱怨:DeepSeek-V4-Flash 在 B300 上 v0.26 需三个外部补丁才能跑;v0.27 输出随机退化为重复 token 或长段乱码(用户贴出”模型在痛苦地试图结束 thinking”的原始输出);Gemma-4 在 RTX 6000 上进程卡死需重启;高并发同样触发乱码
  • 工程经验:有用户称 0.28 之前数天的 commit 已在 2×H200 上稳定运行 DeepSeek-V4-Flash,建议直接尝试 0.28
  • reasoning_content 兼容性问题未实质修复,仅有文档说明(PR #50624),用户明确不满
  • 功能差距:sampler 支持仍落后 llama.cpp(top-n-sigma、DRY、XTC 等缺失),被回”欢迎提交 PR”
  • 旧硬件:Pascal 架构不被支持,用户认为 NVIDIA 放弃支持不代表 vLLM 必须放弃(llama.cpp 仍支持)
  • 有用户负载测试直接把 vLLM 跑崩;与 SGLang 的稳定性对比无人正面回答

🔗 原文 · HN 讨论页

I accidentally turned LLM memory into program analysis#

271 pts · 71 comments · pwning.systems

📌 内容总结

  • 作者在漏洞研究中使用 LLM agent 时的痛点:长时调查中模型不断重提已排除的假设、从已失效的前提继续推理,“记忆”无法自动传播事实失效
  • HN 关注点:
    • 方案 Lemmalog:LLM 只做模糊前端(自然语言 / debugger 输出 → 结构化事实),Datalog 引擎负责派生、撤回、溯源与增量更新
    • 关键设计:多支持计数(结论被多个独立事实支持时不误删)、provenance 依赖树、事实有效期(区分”现在不成立”与”当时为何相信”)、实体消解
    • 基准:LongMemEval F1 0.463±0.010(PropMem 0.550 / SimpleMem 0.480 / full context 0.222,作者用 GPT-4.1 全上下文仅 0.197);LoCoMo F1 0.533±0.001(PropMem 0.605 / OpenClaw 0.557 / full context 0.542)
    • 知识更新类别 0.579 超过 PropMem 的 0.528;对抗性假前提 0.707 vs full context 0.509;弱项为多会话(0.211)与 inference(0.164)
    • 查询上下文缩小约 38 倍(LongMemEval:104K → 2.7K tokens/question)

💬 讨论总结

  • 共识:LLM 应只做终端(自然语言理解/生成),中间用确定性引擎维护状态;“LLM 应该做所有事”被反复批评
  • 历史背景:多位评论指出这是 Cyc / 符号 AI 的回归路线——从 Datalog 出发会需要量词、非单调逻辑(answer set programming)和”for most”;也有人认为 LLM 厂商正转向 neuro-symbolic,只是不公开承认
  • 工程经验:provenance 应绑定源文件版本/内容哈希,源变更时只重估相关语句;Datalog 规则微分可生成 delta,不必维护完整支持图
  • 现实场景印证:硬件故障排查、选举事实跟踪、交易建议等用户报告了相同痛点(已排除结论被重新提起),手工决策日志是目前常见缓解手段
  • 关系澄清:被问”是否只是另一种 Graph RAG”,回复认为更像手搓 CodeQL
  • 风险/限制:条件性知识(“和朋友一起时喜欢热闹餐厅”)无法扁平化为无条件事实;抽取质量是主要瓶颈——多会话失败的主因是事实未被提取,而非推导错误
  • 相关项目:DeepClause(SWI-Prolog / WASM)、Scallop(neuro-symbolic Datalog)、cave lang 被提及作为同类尝试

🔗 原文 · HN 讨论页