2,460 字
晚报 | EVENING 2026-08-13
Grok 4.6 与 DeepSeek V4 Pro 同日发布,微信官宣 WeLM 模型
今日要点
- Grok 4.6 发布,API 定价输入 2 美元/百万 token
- DeepSeek V4 Pro 0813 正式上线,OpenRouter 同步接入
- Lovable 完成 4 亿美元融资,估值 133 亿美元
xAI 发布 Grok 4.6,API 定价输入 2 美元/输出 6 美元;DeepSeek V4 Pro 0813 正式上线,多个 Agent 测评成绩超预览版;微信官宣 WeLM-80B/617B;微软发布自研推理模型 MAI-Thinking-1;Lovable 融资 4 亿美元。
1. [持续跟踪] xAI 发布 Grok 4.6#
- 前情提要:Elon Musk 此前在 Grok Bot 发布时预告,Grok 4.6 将于本周内上线。
- 最新突破:xAI 今日正式推出 Grok 4.6,官方称相比 Grok 4.5 能力显著提升而价格不变;API 定价为每百万 token 输入 2 美元、输出 6 美元,约为其他前沿模型的一半。模型确认 1.5T 参数、50 万 token 上下文。
- 评测表现:官方基准中,Grok 4.6 在 GDPVal-AA(1753)、AA-Briefcase(1577)等知识工作评测上领先,Terminal-Bench 2.1 达 88.4%;Artificial Analysis 综合指数 61 分,与 GPT-5.6 Sol Max 持平;LMArena Code Arena WebDev 首日以 1618 分进入第 7 名。
- 生态接入:上线当天覆盖 Cursor、Grok Build、Grok Bot 与 API,Devin、Poe、Notion、Genspark、AI SDK 等同步接入;Cursor 与 Grok Build 首周提供 2 倍用量。
- 后续预期:马斯克称 Grok 4.7 将在一个月内发布,并表示 SpaceX 训练语料使其在真实工程能力上很难被超越。
- 行业意义:以半价提供接近第一梯队的知识与 Agent 能力,Grok 系列进入主流性价比选项,模型发布的生态接入速度已成为竞争关键。 🔗 xAI 官方发布 | SpaceXAI 推文 | LMArena 榜单 | 模型卡
2. [持续跟踪] DeepSeek V4 Pro 0813 正式版发布#
- 前情提要:DeepSeek V4 Pro 预览版已上线数月,官方于 8 月 6 日预告 API 将整体上调价格。
- 最新突破:DeepSeek 将 API 模型版本更新为 DeepSeek-V4-Pro-0813,支持 1M 上下文与最大 384K 输出,默认开启思考模式,同时兼容 OpenAI 与 Anthropic 两套 API 格式。此次价格维持不变:输入(缓存未命中)3 元/百万 token,输出 6 元,缓存命中输入 0.025 元;并发限制 500。
- Agent 能力:多个 Agent 相关基准相比预览版跃升——DeepSWE 12.8→62.7、DSBench-Hard 翻倍至 67.2、NL2Repo 38.5→61.5、Terminal-Bench 2.1 达到 87.9;Cline 称其性能接近 Fable 5,成本约为 1/57。
- 生态接入:OpenRouter、ClinePass、OpenCode Go、EasyRouter 等在数小时内接入;LMArena WebDev 早期 AutoEval 为 1607 分,居开源模型第二。实测显示,模型可将模糊指令自主规划为网站、游戏与 3D 模拟等完整交付物。
- 后续看点:DeepSeek 官方文档透露基准测试使用“DeepSeek Harness 极简模式(即将发布)”,且 Harness 团队公众号已注册,或为下一发布节点。
- 行业意义:正式版补齐预览版最明显的 Agent 短板,并以极低价格进入第一梯队区间;若 Harness 如期落地,DeepSeek 将从“便宜模型”升级为“模型+框架”的整套 Agent 方案。 🔗 DeepSeek API 定价 | OpenRouter 上线 | Cline 测试 | 爱范儿实测
3. 微信官宣 WeLM 系列大模型#
- 核心发布:微信官方 X 账号首次公开 WeLM(Weixin Language Model)系列,主打资源效率:
- WeLM-80B:总参数 800 亿、每次激活 30 亿,已部署到微信原生 AI 助手“小微”,支持对话与搜索、操作微信原生功能、调用小程序服务。
- WeLM-617B:总参数 6170 亿、每次激活 230 亿,面向小程序智能开发和“小微”小工具生成,仍处研发阶段。
- 产品定位:与混元并行,WeLM 被定位为面向微信场景与推理效率的定制模型,由微信团队自研。
- 行业意义:超级应用开始为自身 Agent 场景自研“小而高效”的 MoE 模型,模型选型从通用基座转向场景专用的资源效率竞争。 🔗 WeChat 官方推文 | 爱范儿早报
4. 微软发布自研推理模型 MAI-Thinking-1#
- 核心发布:微软 AI 负责人 Mustafa Suleyman 宣布,微软首个自研推理模型 MAI-Thinking-1 已从零训练完成,并在 Microsoft Foundry 中可用。
- 能力侧重:团队在首发反馈邀请中特别提到“tool use”,表明该模型优先面向工具调用与 Agent 工作流,而非单纯冲刺基准排行。
- 行业意义:继 MAI-Code 代码模型后,微软补齐自研推理模型一环,其模型栈正逐步摆脱对单一外部模型供应商的依赖。 🔗 Mustafa Suleyman 推文 | Finbarr Timbers 评论
5. 阿里 Qwen3.8-2.4T 开放权重,Unsloth 量化至 397GB 可本地运行#
- 核心发布:Qwen 在 Hugging Face 开放 Qwen3.8-2.4T-A95B 权重,总参数 2.4T、激活 95B,是 Qwen 首次开放 Max 级模型;原生支持 26 万 token 上下文(可扩展至 101 万),并支持 reasoning_effort 调节。
- 生态适配:vLLM、SGLang 提供 Day-0 支持,并为 NVIDIA B300、AMD MI355X 提供 4-bit checkpoint;Together AI、Baseten、Fireworks 同日上线托管。
- 本地化:Unsloth 用 Dynamic 1-bit 量化将模型从 4.9TB 压缩到 397GB,可在 410GB+ RAM/VRAM 设备通过 Unsloth Desktop 本地运行。
- 注意点:该权重版本为纯文本,初始不含视觉输入;许可证包含收入门槛限制。
- 行业意义:2.4T 级开源权重配合激进量化进入本地可跑区间,开源模型与闭源前沿的部署差距被进一步压缩。 🔗 Hugging Face 权重 | Unsloth 量化 | Fireworks 上线
6. Lovable 完成 4 亿美元融资,估值 133 亿美元#
- 核心发布:AI 应用构建平台 Lovable 宣布完成 4 亿美元 C 轮融资,由 Menlo Ventures 领投、EQT 旗下 Scaleup Europe Fund 联合领投,估值达到 133 亿美元。
- 最新数据:Lovable 上构建的应用月访问量达 9 亿次,过去 12 个月 ARR 增长 4 倍。
- 产品方向:公司称下一步从“构建软件”延伸到“构建并运营业务”——加深销售、运营、营销、财务等集成,默认安全,并保持模型中立。
- 行业意义:AI 编程平台估值持续走高,产品竞争从“生成代码”转移到“让生成的软件真正跑通业务流程”。 🔗 Lovable 官方公告 | Anton Osika 推文
7. Google DeepMind 发布 SL2T 手语转文字模型#
- 核心发布:DeepMind 公布 SL2T(Sign Language-to-Text)模型,可把手语视频实时转为文字,首批支持美国手语(ASL)→英语,在 Pixel 11 的 Gboard 与 Live Transcribe 中落地。
- 技术细节:SL2T 学术基准达到 SOTA,并为“单手持机手语”等真实场景优化;身体姿态追踪在设备端完成,服务器端仅负责将姿态转为文字,避免原始视频上传。
- 开发方式:模型与聋人社群、Deaf Googlers 及手语顾问委员会共同设计。
- 行业意义:手语作为输入模态第一次进入主流移动系统,AI 无障碍能力从“识别内容”扩展到“理解身体语言”。 🔗 DeepMind 官方 | DeepMind 博客
8. 自变量 WALL-B 物流分拣反超 Figure 03#
- 核心事件:自变量机器人使用通用具身大模型 WALL-B 进行一小时物流分拣直播,处理 1816 件随机包裹,短时吞吐超过 Figure 03 此前标杆约 45%,准确率超 98%,全程无人干预。
- 硬件路线:与 Figure 03 的完整人形+灵巧手不同,自变量采用双臂+标准夹爪,据称方案成本下降约 70%。
- 技术基础:WALL-B 采用世界统一模型(WUM)架构,将视觉、语言、动作与物理变化预测放同一网络联合训练,用模型智能补偿简化硬件的自由度不足。
- 行业意义:具身智能首次出现“更便宜的身体+更聪明的模型”在真实任务中反超人形路线的公开数据,硬件成本与部署门槛有望被重新估值。 🔗 爱范儿报道 | 量子位报道
9. Higgsfield 制作 110 分钟 AI 剧情长片并全量开源#
- 核心事件:Higgsfield 与 Cully Games 基于 Seedance on Higgsfield 完成 110 分钟剧情长片《The Cully Hill Boys》,制作周期 4 周、花费 200 万美元,真人演员以肖像授权方式参与。
- 开放内容:所有提示词、素材、角色文件全部公开,可免费复用。
- 行业意义:AI 视频生产从几十秒镜头 Demo 跨入完整长片生产流程,制片周期与成本结构被压缩;这仍是单点案例,但为长片级 AI 制作提供了一个可复用的工作链样本。 🔗 Higgsfield 官方 | 小互转述
10. LMArena 发布 AutoEval:用历史人类对战预测新模型偏好#
- 核心发布:LMArena 发布 AutoEval——用数千万条历史人类对战数据训练奖励模型,为尚未积累足够人类投票的新模型自动评分,将评估反馈从数周压缩到数小时。
- 与 LLM-as-judge 的区别:AutoEval 的提示与回答全部来自真实人类对战,奖励模型只是人类偏好的代理,因此仍是一个“活的”基准。
- 首批结果:DeepSeek-V4-Pro (Max) 在 Text Arena 以 1465 分位列开源模型第 5,在 WebDev 以 1607 分居开源第 2;分数将随真实人类投票继续收敛。
- 行业意义:模型发布进入“周更”后,人工众测成为瓶颈;基于人类偏好的自动评估为新模型提供了一条可扩展的初筛路径。 🔗 LMArena 发布 | WebDev 评测 | 排行榜