腾讯开源 Hy4-preview,OpenAI 重置 Codex 额度,MiniMax 实时视频生成
- 腾讯开源 Hy4-preview,vLLM 首日支持 FP8 推理
- OpenAI 重置 Codex 额度,修复 8 类 token 消耗问题
- MiniMax H3-Max 9 秒生成 15 秒视频,接入 Twitch 直播
腾讯开源 Hy4-preview(770B/49B MoE,Apache 2.0),vLLM 首日支持 FP8 推理;OpenAI 重置 Codex 付费用户额度,修复 8 类消耗,可用时长提升 10%-50%;MiniMax H3-Max 9 秒生成 15 秒视频,接入 Twitch 直播。
1️⃣Codex 重置全部付费用户额度,修复 8 类 token 消耗问题#
- 核心:OpenAI 为 Codex 与 ChatGPT Work 所有付费用户重置使用额度,同等额度实际可用时长提升 10% 到 50%。
- 修复清单:上下文压缩时旧图片未清理(重度图片用户消耗降约 10%);
/goal越过停止条件导致单周 15%-70% 额度空耗;子智能体未经指令擅自调用更强模型;MCP 工具结果重复编码等。 - 后续机制:官方已做架构层调整防止问题回归,并计划在应用内直接展示额度消耗去向。 🔗 Tibo 公告 | 宝玉解读
2️⃣[持续跟踪] MiniMax H3-Max:9 秒生成 15 秒视频,催生无限动画直播#
- 前情提要:MiniMax 开源 H3 权重后,fal 基于其做后训练与推理优化,推出 H3-Max,速度较原模型提升约 50 倍。
- 最新进展:开发者 @levelsio 将 H3-Max 接入 Twitch 直播流,实现“永不停播的动画频道”;MiniMax 官方转发称这是开放权重生态的自我证明。
- 行业影响:视频生成从“分钟级等待”进入“实时生成”区间,持续直播、交互式内容等新应用形态有了基础设施支撑。 🔗 MiniMax 官方声明 | levelsio 演示 | Hailuo 转发
3️⃣[持续跟踪] OpenAI 终止 Cursor 访问,模型与 harness 分离成为焦点#
- 前情提要:OpenAI 因 Cursor 被 SpaceX 收购触发控制权变更条款,提议 11 月 12 日终止 Cursor 对 OpenAI 模型的直接访问。
- 最新进展:Cursor CEO Michael Truell 回应称 OpenAI 模型约占 Cursor 流量的 5%,正在与 OpenAI 协商;LangChain CEO 与多位开发者将此视为“模型与 harness 必须解耦”的案例。
- 行业影响:模型提供方垂直整合的趋势正在重塑第三方 Agent 工具的供应链,跨模型工具链的价值被重新评估。 🔗 Cursor 回应 | Harrison Chase 评论 | elvis 观点
4️⃣[持续跟踪] 腾讯 Hy4-preview 开源,vLLM 首日支持 FP8 推理#
- 前情提要:腾讯混元开源 Hy4-preview:770B 总参数、49B 激活的 MoE,支持 1M 上下文,Apache 2.0 许可。
- 最新进展:vLLM 宣布 Hy4-preview 发布首日即可运行,已通过 NVIDIA GPU 验证;FP8 单命令部署:
VLLM_ENABLE_HPC_OPS=1 vllm serve tencent/Hy4-preview-FP8 -tp 8。 - 架构细节:256 个路由专家加 1 个共享专家;每次查询只关注 2048 个 token;78 层中仅 21 层计算自己的稀疏索引;checkpoint 内置 10B MTP 层,活性 0.7B,草稿深度 3。
- 意义:顶级开源 MoE 的部署成本被进一步压低,端到端推理方案成为开源模型竞争的新战场。 🔗 腾讯混元推文 | vLLM 集成说明
5️⃣Claude Code 周额度变更:9/14 起永久提升 25%#
- 官方口径:9 月 14 日起,Pro、Max、Team 与 Enterprise 的 Claude Code 标准周限额将永久提高 25%;此前的临时 50% 增幅只持续到该日期。
- 净效应:对比当前临时窗口,用户实际可用额度将减少约 17%,但此后不再有临时调整的不确定性。
- 影响:额度从“临时加赠”转向“永久基线”,重度用户的成本规划更明确,但短期感知仍是收紧。 🔗 ClaudeDevs 公告 | 宝玉量化分析 | 社区换算
6️⃣马斯克:2027 年约 15GW AI 算力无法按时通电#
- 核心判断:基于共识估计,2027 年生产的 AI 算力中约有 15GW 当年无法接入电网启用,缺口来自电力之外的全链条配套。
- 卡点拆解:变压器、线缆、液冷管路、大型冷水机组与复杂网络建设都需要同步到位,而不仅仅是找到电源。
- 影响:GPU 供给若持续跑在配套基建前面,算力利用率和推理定价都可能被进一步推高。 🔗 马斯克推文
7️⃣MIT 实验:不通信的 AI agent 群体自发分工,并留下超越创建者的技术#
- 实验设计:数百个初始相同的 agent 被放入一个可永久修改的世界,无预设角色、无直接通信,仅通过环境进行协调。
- 涌现现象:agent 自发分化出探索者、建造者、照料者与协调者;76% 的产物由多个 agent 协作完成,最深的技术谱系超过 12 个 fork。
- 关键数据:约 95% 的首次技术复用来自对环境中已有物件的观察,而非发明者的直接交接;移除全部 agent 后,其建造的技术仍能承受未知扰动继续运行。
- 安全含义:agent 可以通过持久化环境进行长时协调,这暴露了只监控 agent 间通信的评估盲区。 🔗 MIT 教授推文 | elvis 转述
8️⃣Notion 把 Agent 搬进工作流:Custom Agents API 公测 + 8 项 AI 更新#
- API 公测:Custom Agents API 进入公开测试,agent 可被接入 Slack bot、内部仪表盘和外部客服流程。
- Agent 一等公民化:页面可以像分享给同事一样分享给自定义 agent;AI Meeting Notes 完成后可自动触发 agent;通过对话可直接生成可复用 Skill。
- 新增控制:Effort 控制允许用户设定 AI“思考强度”;AI 用量视图可查看配额花在哪;模型选择器按提供方分组并支持收藏。 🔗 Notion 功能帖 | Custom Agents API 公告 | AI Usage 视图
9️⃣企业 AI agent 进入务实期:马士基 200+ 实例、Box 上线即重建#
- 核心判断:AI Engineer World‘s Fair 的 AI-Native 企业专场提出,“agent loop 不是系统,系统在 loop 周围”。
- 一线数据:马士基运行 200+ agent 实例,质量提升来自 9 个月内 10 万次专家修正而非更大模型;Box 的 agentic 搜索周二上线、周三开始重建,agent 基础设施半衰期以月计;Millennium 采购流程约 5% demo 转化率,试点周期从半年缩短到两周。
- 信号:企业 agent 落地的差距正从“模型质量”转移到“工程与维护机制”。 🔗 AI Engineer 直播 | 五条事实总结
🔟Apple 提出 Agent Seer:从 MCP 规范自动合成 agent 评测集#
- 创新点:仅凭一个 MCP server 规范,无需示例、无需真实工具调用,即可生成多轮 agent 测试场景——函数名、自然语言描述和参数 schema 已携带足够语义。
- 评测发现:参数 schema 的复杂度比工具集大小更能预测质量差异;参数值准确性是最主要的失败维度,这无法被粗粒度的名称匹配型工具调用指标捕捉。
- 应用前景:MCP 规范更新后可直接生成回归测试,缓解手工基准随 API 变更而过时的问题。 🔗 论文地址 | elvis 书评
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| THU-MAIC/OpenMAIC | AI Agent / 教育 | 22.2k |
| workweaver/router | AI Infra / 模型路由 | 2.7k |
| addyosmani/agent-skills | Agent 工程 / 工具链 | 90.7k |
1. THU-MAIC/OpenMAIC ⭐ 今日 +907#
语言/许可: TypeScript / MIT
总 Stars: 22.2k
仓库: GitHub
项目定位:
开源多智能体交互课堂平台,将任意主题或上传材料自动转化为由 AI 教师与 AI 同学实时互动的完整课程。解决课程制作中内容编排与互动设计的高人力成本问题。
核心功能:
- 一键生成课程:输入主题或附件,自动产出幻灯片、测验、交互式 HTML 模拟与项目制学习(PBL)内容
- Agent 工作台:基于持久化会话的对话式编排,可规划、构建、修订整门课程,支持取消、恢复与材料上传
- 多智能体实时课堂:AI 教师/同学支持白板绘图、TTS 语音讲解与实时讨论
- 开放集成与导出:导出 .pptx/离线 HTML,支持 OpenClaw 从飞书、Slack、Telegram 等消息应用触发生成
技术亮点: 基于 LangGraph 的多智能体编排,模型、搜索、存储均采用 provider-neutral 可插拔设计,并提供 @openmaic/* SDK 与 Postgres 持久化参考实现。
2. workweaver/router ⭐ 今日 +284#
语言/许可: Go / NOASSERTION
总 Stars: 2.7k
仓库: GitHub
项目定位:
面向 Agent 系统的模型路由网关,通过 OpenAI-compatible 端点自动为每个 prompt 选择最优模型。解决 Agent 工作负载中“全流量使用顶级模型”造成的成本与延迟浪费。
核心功能:
- 单次路由决策延迟 <50ms
- 宣称可削减 40-70% 推理成本
- 兼容 OpenAI API,仅需修改 base_url 即可接入
- 针对 Claude Code、Codex 等 agentic coding 工具场景优化
技术亮点: Go 实现,以低延迟路由层嵌入现有 agent 工作流,对客户端透明。
3. addyosmani/agent-skills ⭐ 今日 +196#
语言/许可: JavaScript / MIT
总 Stars: 90.7k
仓库: GitHub
项目定位:
面向 AI 编程代理的生产级“技能”包,将资深工程师的工作流、质量门禁与最佳实践编码为可复用的 Markdown 工作流。解决 AI agent 在真实项目中流程缺失、质量不稳定的问题。
核心功能:
- 25 个技能覆盖 define / plan / build / test / review / ship 全生命周期
- 9 个斜杠命令(
/spec、/build、/review等)按阶段自动激活对应技能 - 通过 skills CLI 可安装到 70+ agent(Claude Code、Cursor、Codex、Copilot、Gemini CLI)
- 每个技能内置验证门禁与 anti-rationalization 表,强调测试驱动与增量交付
技术亮点: 纯 Markdown 技能格式配合 vercel-labs/skills 生态,实现了跨主流 agent 工具的可移植安装与自动发现机制。
🟧 Hacker News 热议#
Tencent Releases and Open-Sources Tencent Hy4 Preview#
158 pts · 97 comments · tencent.com
📌 内容总结
- 腾讯官方发布博客,但原文抓取快照失败(仅缓存到图标),以下核心事实来自 HN 讨论中引用/转述的博客内容
- HN 关注点:
- Hy4 规格:770B 总参数 / 49B 激活参数的 MoE 模型,上下文窗口超 1M tokens,Apache 2.0 许可证
- OpenRouter 上线数天即处理数万亿 tokens,超过 GLM 5.3 一周的量;cache 读取定价 5%,低于常见的 10%/20%
- 官方称 Hy4 首次参与自身开发流程:自动化优化训练方法、数据策略、评估框架与底层算子,形成早期递归自我改进循环
💬 讨论总结
- 商业现实:OpenRouter 的高用量被质疑为厂商付费买曝光;有评论专门分析过 cache read 成本是推理账单中常被隐藏的大头,认为 5% 定价才是真正竞争力,且 <$0.01/MTok 的 cache 读取市场存在空白
- 用户实测(Hy3):作为通用 agent 模型仅次于 deepseek4-flash,行为与 DeepSeek 高度接近,被怀疑是 fork;preview 到正式版存在”不可用→可竞争”的跃升;速度是普遍短板
- 开源语义之争:open weights 被贬为”可在本地运行的二进制 blob”,不构成开源;反驳称 Apache 2.0 允许微调/继续训练,模型本质是”有损压缩的数据集”
- 对”递归自我改进”的解读:有评论联系 ai-2027 预测,认为中国已无需窃取权重;也有评论将此类预测斥为无依据的”tech bro 酒后猜测”,实际追赶路径更可能是蒸馏
- 风险/限制:官方图表柱高与数值不符,疑似 AI 生成;实际 benchmark 请求频繁超时/限流,provider 不可用
- 地缘政治情绪:个别评论欢呼中国开源打破美国双寡头垄断,被反驳为空洞且无实质内容
vLLM v0.28.0#
87 pts · 30 comments · github.com/vllm-project
📌 内容总结
- vLLM 0.28.0 发布说明:584 commits / 270 contributors(76 位新贡献者)
- HN 关注点:
- Kimi-K3 全栈优化:Decode Context Parallel、fused FlashKDA kernel、GEMM-RS 序列并行、1.5–3x kernel 级加速、自适应 speculative token budget 提升 DSpark TTFT 约 60%、shared-expert sharding 每 GPU 省 ~17 GiB
- DeepSeek V4:sparse MLA 端到端支持(plain decode / MTP / DSpark)、AMD Quark NVFP4、ROCm gfx11/gfx950 启用
- 破坏性变更:bitsandbytes 移至 out-of-tree 插件、Transformers 升至 5.15.0
💬 讨论总结
- 稳定性是主要抱怨:DeepSeek-V4-Flash 在 B300 上 v0.26 需三个外部补丁才能跑;v0.27 输出随机退化为重复 token 或长段乱码(用户贴出”模型在痛苦地试图结束 thinking”的原始输出);Gemma-4 在 RTX 6000 上进程卡死需重启;高并发同样触发乱码
- 工程经验:有用户称 0.28 之前数天的 commit 已在 2×H200 上稳定运行 DeepSeek-V4-Flash,建议直接尝试 0.28
- reasoning_content 兼容性问题未实质修复,仅有文档说明(PR #50624),用户明确不满
- 功能差距:sampler 支持仍落后 llama.cpp(top-n-sigma、DRY、XTC 等缺失),被回”欢迎提交 PR”
- 旧硬件:Pascal 架构不被支持,用户认为 NVIDIA 放弃支持不代表 vLLM 必须放弃(llama.cpp 仍支持)
- 有用户负载测试直接把 vLLM 跑崩;与 SGLang 的稳定性对比无人正面回答
I accidentally turned LLM memory into program analysis#
271 pts · 71 comments · pwning.systems
📌 内容总结
- 作者在漏洞研究中使用 LLM agent 时的痛点:长时调查中模型不断重提已排除的假设、从已失效的前提继续推理,“记忆”无法自动传播事实失效
- HN 关注点:
- 方案 Lemmalog:LLM 只做模糊前端(自然语言 / debugger 输出 → 结构化事实),Datalog 引擎负责派生、撤回、溯源与增量更新
- 关键设计:多支持计数(结论被多个独立事实支持时不误删)、provenance 依赖树、事实有效期(区分”现在不成立”与”当时为何相信”)、实体消解
- 基准:LongMemEval F1 0.463±0.010(PropMem 0.550 / SimpleMem 0.480 / full context 0.222,作者用 GPT-4.1 全上下文仅 0.197);LoCoMo F1 0.533±0.001(PropMem 0.605 / OpenClaw 0.557 / full context 0.542)
- 知识更新类别 0.579 超过 PropMem 的 0.528;对抗性假前提 0.707 vs full context 0.509;弱项为多会话(0.211)与 inference(0.164)
- 查询上下文缩小约 38 倍(LongMemEval:104K → 2.7K tokens/question)
💬 讨论总结
- 共识:LLM 应只做终端(自然语言理解/生成),中间用确定性引擎维护状态;“LLM 应该做所有事”被反复批评
- 历史背景:多位评论指出这是 Cyc / 符号 AI 的回归路线——从 Datalog 出发会需要量词、非单调逻辑(answer set programming)和”for most”;也有人认为 LLM 厂商正转向 neuro-symbolic,只是不公开承认
- 工程经验:provenance 应绑定源文件版本/内容哈希,源变更时只重估相关语句;Datalog 规则微分可生成 delta,不必维护完整支持图
- 现实场景印证:硬件故障排查、选举事实跟踪、交易建议等用户报告了相同痛点(已排除结论被重新提起),手工决策日志是目前常见缓解手段
- 关系澄清:被问”是否只是另一种 Graph RAG”,回复认为更像手搓 CodeQL
- 风险/限制:条件性知识(“和朋友一起时喜欢热闹餐厅”)无法扁平化为无条件事实;抽取质量是主要瓶颈——多会话失败的主因是事实未被提取,而非推导错误
- 相关项目:DeepClause(SWI-Prolog / WASM)、Scallop(neuro-symbolic Datalog)、cave lang 被提及作为同类尝试