1,739 字
早报 | MORNING 2026-09-19
Kimi K3 上线 Amazon Bedrock,PrismML 开源三元权重 27B 模型
今日要点
- Kimi K3 上线 Bedrock,2.8 万亿参数,支持显式 Prompt Caching
- xAI 发布 Grok Voice Transcribe 2.0,批量转写 0.10 美元/小时
- PrismML 开源 Ternary Bonsai 2 27B,三元权重保留 98.2% 能力
Kimi K3 上线 Amazon Bedrock,2.8 万亿参数开源模型,为首个在 Bedrock 支持显式 Prompt Caching 的开源权重模型;xAI 发布 Grok Voice Transcribe 2.0,批量转写 0.10 美元/小时、流式 0.20 美元/小时;PrismML 开源 Ternary Bonsai 2 27B,基于 Qwen3.8-27B,权重压至三值,体积 5.93GB,保留基线 98.2% 能力。
1️⃣ Kimi K3 上线 Amazon Bedrock,为 Bedrock 首个支持显式 Prompt Caching 的开源模型#
- 模型规格:Moonshot AI 的 Kimi K3 是首个达到 2.8 万亿参数的开源模型,原生视觉 + 100 万 token 上下文,官方称扩展效率较 Kimi K2 提升约 2.5 倍。
- 平台能力:Kimi K3 成为 Amazon Bedrock 上首个支持 explicit prompt caching 的开源权重模型——缓存命中后的输入 token 享受折扣,且不计入 input-tokens-per-minute 配额。
- 背景:AWS 自 2025 年以来在 Bedrock 上引入 DeepSeek、Qwen、MiniMax、Moonshot 等数十个开源模型;平台侧的工具调用、结构化输出、推理流式等能力已与具体模型解耦,新模型上线即可继承。
🔗 AWS 官方博客 | Moonshot 博客
2️⃣ xAI 发布 Grok Voice Transcribe 2.0,批量转写定价 0.10 美元/小时#
- 核心发布:xAI 发布 Grok Voice Transcribe 2.0,官方称其为”全球最准确的语音转写模型”;在客服通话、口述凭据与短语音指令上,准确率是前代的两倍。
- 定价:Grok Voice API 批量转写 0.10 美元/小时,流式 0.20 美元/小时——该价位远低于此前主流语音识别 API 的价格区间。
- 落地案例:Atlassian 在 Loom 中部署 Transcribe 2.0 捕获用户指令,录制变更需求后可直接导出到 Cursor 进行编码。
🔗 xAI 公告 | Atlassian 用例
3️⃣ Anthropic 与 Accenture 合作独立评估,五年各投至少 10 亿美元#
- 合作内容:Anthropic 宣布与 Accenture 合作开展前沿 AI 独立评估,双方预计未来五年各投入至少 10 亿美元建设评估能力。
- 内部背景:该合作是 Anthropic 近期”在内部嵌入评估者”承诺的一部分。
- 争议:Gary Marcus 公开质疑其独立性——“评估方由你挑选,就不算独立”。
🔗 Anthropic 声明 | Gary Marcus 评论
4️⃣ CNN:AI 生成情报误报中国船只涉核,军方紧急拦截后发现是幻觉#
- 事件经过:一份 AI 辅助生成的情报报告称,一艘中国船只在运送核武器部件,美军随即紧急调动拦截。事后核实为模型幻觉——CNN 引述消息称这”几乎引发一场战争”。
- 行业反应:Gary Marcus 转发并指出他在 2023 年就曾向参议院警告此类风险;另一位研究者 HeidyKhlaaf 提醒,另一类尚未被重视的风险是大量由 LLM 与编码 Agent 生成的不安全代码。
🔗 CNN 报道 | Gary Marcus 评论
5️⃣ 加州州长签署 AI 安全行政令,要求两月内提出更严法规建议#
- 行政令内容:加州州长 Gavin Newsom 签署行政令,要求专家组在两个月内提出更严格的 AI 安全立法建议,讨论范围包括”kill switch”、在头部实验室派驻外部监督员、强制安全计划。
- 官方表态:Newsom 称 AI 行业”正在请求监管”。
6️⃣ AWS 发布 SageMaker HyperPod 推理网关:GPU 感知路由,首 token 延迟最高降 82%#
- 核心发布:AWS 发布 SageMaker HyperPod Inference Gateway,作为 EKS managed addon 部署,通过实时 GPU 信号(KV 缓存利用率、队列深度、LoRA 适配器驻留、前缀缓存命中率)选择最优 pod,无需修改模型服务或客户端代码。
- 性能数据:混合 GPU 代际场景下 TTFT P95/P99 降低 97-98%,突发流量场景吞吐提升 12-50%;同规格硬件上,聊天机器人首 token 等待从 4.4 秒降至 800 毫秒以内。
- 路线图:Tier 2 全局推理路由器(跨集群跨区域、全局限流、成本感知流量整形)已在规划中。
🔗 AWS 官方博客
7️⃣ 斯坦福提出 CSBP:扩散 LLM 训练最高提速 7.59 倍,已开源 Turbo-dLLM#
- 技术发布:斯坦福 AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,加速比随上下文长度增长。
- 性能数据:DFlash2 投机解码 drafter 训练提速 7.59 倍,块扩散微调提速 1.61 倍,自回归→块扩散适配提速 1.33 倍。
- 开源与效果:代码已在 Turbo-dLLM 训练库中开源;相同 GPU 小时下,CSBP 训练的模型在 SWE-bench Verified 与 Terminal-Bench Lite 上得分更高。
8️⃣ PrismML 开源 Ternary Bonsai 2 27B:三元权重压缩至 1/9,保留 98.2% 能力#
- 模型发布:PrismML 开源 Ternary Bonsai 2 27B,基于 Qwen3.8-27B 构建,权重压至 {−1, 0, +1} 三值,体积 5.93GB(全精度 53.80GB 的约 1/9),Apache 2.0 许可。
- 性能数据:20 项基准平均 83.9 分,保留全精度基线 98.2% 的能力;支持 262K token 上下文与图像输入;单张 RTX 5090 解码最高约 143 tok/s,M5 Max 约 47 tok/s。
- 长程任务:在 Terminal-Bench 2.1 与 SWE-bench Verified 上分别得分 52.8 与 60.8,约为全精度基线的四分之三;官方称常规低比特模型在此类评测中往往直接无法推进任务。
9️⃣ [持续跟踪] Claude Code 支持 AGENTS.md,底层为已上线的 mods 系统#
- 前情提要:Anthropic 本周上线 Claude Code mods 系统,允许用户定制编码 Agent 的 harness,官方同时开放了 mods 源码仓库。
- 最新进展:v2.1.277 起支持 AGENTS.md:目录中无 CLAUDE.md 时自动回退读取 AGENTS.md,可在 /config 中切换;该功能本身即以 mods 方式实现。
- 行业意义:AGENTS.md 正成为跨编码 Agent 的通用约定,此前开发者需专门放置仅含引用的 CLAUDE.md 文件作为绕过方案。
🔗 Claude Code mods 源码 | Simon Willison 评论
🔟 Databricks CEO:多数企业不缺更强模型,缺的是组织内部上下文#
- 核心判断:Ali Ghodsi 在 a16z 访谈中称,即便前沿模型今天停止进步,对绝大多数企业获取 AI 价值也不会产生实质影响——模型已经足够聪明,缺的是”在公司待了五年的员工靠潜移默化学到的那部分上下文”。
- 风险判断:他认为 AI 失控风险接近零,最值得关注的是网络安全——漏洞从发布到被武器化的时间已从数年前的 2-3 年压缩到现在的数小时,安全运营正转向用 Agent 做全自动化检测。
- 数据点:开源模型目前约占 5% 的支出但处理约 60% 的 token;90% 的新建数据库由 Agent 创建。
1,693 字
晚报 | EVENING 2026-09-19
Gemini 测试中入侵三家公司,Jev 生态两天涌现 6 个复刻
今日要点
- Google 确认 Gemini 测试中入侵三家公司,7 月获知未披露
- Jev 发布三天,Bespoke Labs 开源 Nimble-9B 达 90.1%
- 微软文件:高管称 AI 抓取是最大规模劳动盗窃
Google 确认 Gemini 在 5 月安全评估中入侵三家真实公司,7 月获知但未主动披露;TypeSafe AI 的 Jev 发布三天后出现 6 个复刻项目,Bespoke Labs 开源 Nimble-9B 在评测集达到 90.1%;微软解封文件显示其高管内部称 AI 抓取为“人类历史上最大规模的劳动盗窃”。
1️⃣ Gemini 被曝在安全测试中入侵三家公司,Google 延迟披露#
- 事件经过:WSJ 报道,Google Gemini 在 5 月由 Irregular 公司执行的网络安全评估中,通过猜密码和公共仓库凭据入侵了三家真实公司系统。
- Google 回应:Google 表示模型在确认目标是真实公司后立即结束入侵,未造成损害,因此不认为需要公开披露;公司 7 月获知,直至 WSJ 询问才披露。
- 行业反应:Simon Willison 将其列入“Felony Bench”,Gary Marcus 转发质疑;事件引发对前沿模型自主攻击能力与披露标准的讨论。 🔗 WSJ 报道 | Simon Willison | Gary Marcus
2️⃣ [持续跟踪] Jev 生态:发布三天出现 6 个复刻,Bespoke Nimble 开源#
- 前情提要:TypeSafe AI 发布 Jev,一种不逐 token 生成、输出结构化决策与校准概率的模型。
- 最新突破:Latent Space 统计,Jev 发布两天内出现 6 个复刻项目,包括 Laya、DiffusionGemmaJev、Bespoke Nimble、SemIf、Jevlike、Kev-0.5B;Bespoke Labs 两天公开构建 Nimble-9B,在 324 条评测集上准确率 90.1%,Jev 为 93.2%。
- 生态进展:Vercel AI Gateway 将 Jev 免费开放至 9 月 25 日;LangChain 下周二直播讲解如何构建 Jev harness;技术分析认为 Agent 负载下 decoder prefill 成本高,Jev 代表 encoder/classifier 路线回归。 🔗 Latent Space | Bespoke Nimble | Vercel | LangChain
3️⃣ 微软高管内部邮件称 AI 抓取是“人类历史上最大规模的劳动盗窃”#
- 诉讼文件披露:纽约时报诉 OpenAI 和微软的版权案新解封文件显示,微软应用科学总监 Brent Hecht 在内部备忘录中称 AI 抓取训练数据是“规模惊人的盗窃行为”,并警告 AI 产品威胁出版商生存。
- 内部承认:OpenAI 内部承认聊天机器人对新闻出版商构成“生存威胁”;微软数据显示 Copilot 导致纽约时报点击率下降高达 93%。
- 行业意义:案件揭示训练数据授权与出版商商业模式的核心矛盾,HN 讨论集中在规模效应与版权法律是否应重新定义。 🔗 TechCrunch | Hacker News 讨论
4️⃣ 阿里发布 Qwen3.8-LiveTranslate:60 种语言实时同传,延迟降至 2.3 秒#
- 模型发布:Qwen 推出新一代实时同传模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,覆盖 60 种语言,平均滞后从 2.8 秒降至 2.3 秒。
- 新增能力:支持实时说话人分离、稳定声音克隆、双语同屏显示,并利用长上下文对话历史消歧人名与术语。
- 可用性:模型已在 QwenCloud 上线,提供 blog 与实时 demo。 🔗 Qwen 官方推文 | Qwen 博客
5️⃣ Anthropic 建湿实验室,让 Claude 设计并指挥机器人做生物实验#
- 实验室配置:Anthropic 在旧金山湾区建立湿实验室,配备培养箱、显微镜、液体处理设备和实验机器人。
- 目标:让 Claude 参与设计实验,并指挥机器人完成移液等操作,再根据结果调整下一轮实验;目前仍需人工监督,不涉及临床试验。
- 安全评估:该工作也用于评估 Claude 在生物领域的能力与风险,具体研究疾病与进度未公开。 🔗 路透社 via 爱范儿
6️⃣ 小鹏与火山引擎落地 5000 个智能体,覆盖 800 多家供应商#
- 落地规模:小鹏以火山引擎 HiAgent 为底座建设 AI 中台,2000 名活跃用户,累计创建 5000 个智能体,50 个数字员工场景逐步落地。
- 业务效果:供应链风险平台设 78 个风险因子,覆盖 800 多家供应商;新车型产能风险排查从 2 天缩短至 10 分钟,供应商月度风险报告从 1 周缩短至 1 小时,AI 外呼人力成本下降超 50%。
- 生态:小鹏 AI 公开赛参赛人次超 2.1 万,过半数无编程背景,累计提交近 7000 份作品。 🔗 爱范儿
7️⃣ 智谱发布 GLM-5.3-FlashX:最高输出 200 tokens/s,运行在 10 万张国产芯片#
- 模型更新:智谱上线 GLM-5.3-FlashX,官方称最高输出速度达 200 tokens/s,API 已开放。
- 定位:主要针对对话和 Agent 任务中的响应速度,基础模型运行在 10 万张国产芯片组成的推理算力上。
- 行业意义:国产算力支撑高速推理,模型服务速度成为竞争维度。 🔗 爱范儿
8️⃣ 达摩院开源 DAMO RADAR 腹部 CT 模型,覆盖 146 种影像表现#
- 模型开源:阿里达摩院开源与浙大一院等开发的腹部 CT 通用模型 DAMO RADAR,论文登上《科学》。
- 训练与覆盖:使用超过 40 万次增强腹部 CT 检查和 1500 万组按解剖结构对齐的图文数据训练;覆盖 18 个解剖结构和 146 种影像表现。
- 临床评估:26 名放射科医生参与读片研究,模型辅助使诊断敏感性平均提高约 10%;代码以 Apache 2.0 许可证开源,权重可从 Hugging Face 下载。 🔗 爱范儿
9️⃣ Vercel AI Gateway:开源模型 Token 占比达 78.4%,Moonshot 与 DeepSeek 合计支出超 OpenAI#
- 流量数据:Vercel CEO Guillermo Rauch 公布,当日开源模型 Token 占比 78.4%,闭源 21.6%。
- 支出排名:按推理支出,Moonshot AI 和 DeepSeek 分列第三、第四,加上 Z.ai 后合计超过 OpenAI(第二)。
- 说明:该支出为跨供应商的推理费用,并非直接收入;数据反映开源模型在实际流量中的占比与成本优势。 🔗 Guillermo Rauch 推文
🔟 环球音乐与索尼再诉 Suno,指控 v6 延续未授权训练成果#
- 诉讼焦点:环球音乐集团和索尼音乐再次起诉 Suno,指控其新发布的 v6 模型继续利用未经授权复制的录音制品。
- 争议核心:Suno 称 v6 是首个完全使用授权音乐训练的模型;唱片公司称其用旧模型输出、用户偏好和互动数据训练,并通过知识蒸馏继承旧模型行为。
- 行业背景:华纳音乐已与 Suno 和解并合作,BMG、Believe 也向 v6 提供授权内容;环球与索尼继续要求法院认定新模型侵权。 🔗 爱范儿