Yeekal Logo Yeekal
4,098 字
早报 | MORNING 2026-08-29

GLM-5.3 开放权重,Anthropic 黑名单裁定非法

今日要点
  • 智谱开放 GLM-5.3 权重,编码能力提升 50%
  • 联邦法官裁定 Anthropic 黑名单非法
  • Anthropic 公开 Claude 自主对齐实验,Sonnet 5 后训练 Opus 4.8
智谱发布 GLM-5.3 开放权重模型,编码能力提升 50%,Terminal Bench 3.0 从 4.6 升至 28.3;联邦法官裁定特朗普政府将 Anthropic 列入黑名单非法;Anthropic 让 Claude 自主对齐其他 AI,Sonnet 5 后训练 Opus 4.8 接近生产版。

1️⃣ GLM-5.3 全面开放权重,Agentic Coding 与网络防御能力成为主打#

  • 核心发布:Z.ai 正式开放 GLM-5.3 全量权重,官方称其为面向 agentic coding 与 cyber defense 的最强开源模型,支持 1M 上下文与可配置推理强度。
  • 能力提升:相比 GLM-5.2,编码能力提升 50%,在 Terminal Bench 3.0 与 ExploitBench 上刷新开源最优成绩;支持 SGLang、vLLM、Transformers 本地部署。
  • 生态接入:OpenRouter、Ollama(美/欧托管、无数据保留)、Perplexity Computer、Cloudflare AI Search 均在发布当日完成接入。 🔗 Hugging Face 权重 | Z.ai 技术博客 | OpenRouter | Perplexity

2️⃣ a16z 设立 11 亿美元 Machine Age Fund,押注 AI 物理基础设施#

  • 基金方向:a16z 宣布 Machine Age Fund,规模 11 亿美元,面向芯片、内存、网络、系统软件、电力与实体 AI 设备的创始团队。
  • 核心判断:Ben Horowitz 称“1000 名工程师无法抹平两年软件领先,但 GPU 集群可以”,资本正直接转化为算力能力;Martin Casado 认为模型不再是瓶颈,瓶颈在“模型以南”的基础设施。
  • 市场信号:a16z 称超大规模厂商明年 CapEx 或达万亿美元,AI 相关供应已预订至 2028 年,甚至出现数千 GPU 的多日拍卖;硬件方向创始人占比从约 5% 升至 20%-30%。 🔗 a16z 公告 | 完整访谈

3️⃣ Anthropic 让 Claude 自主对齐其他 AI,Sonnet 5 后训练 Opus 4.8#

  • 实验设计:Anthropic 给 Claude 48 小时与 1 块 GPU,让它自主研究、提出并执行对齐干预方案,小模型安全表现“出人意料地好”。
  • 跨代验证:Sonnet 5 对 Opus 4.8 早期 checkpoint 做后训练,安全分数接近完整对齐训练的生产版 Opus 4.8。
  • 基础设施开放:Anthropic 同步发布自动化对齐研究设置,供外部复现;团队承认可测量错误可修复,但细微或罕见失败可能没有 benchmark 可依赖。 🔗 研究公告 | 完整报告

4️⃣ Google DeepMind 论文:Co-Scientist 在真实实验室完成闭环实验#

  • 新进展:DeepMind 的 Co-Scientist 不再只做假设生成,而是直接驱动真实实验,论文覆盖计算机科学、材料合成与生物学。
  • 代表结果:发现一种推理时扩展架构,在 HealthBench Hard 和 Professional 的盲审中超过 6 个前沿模型;设计出 MXene 安全前驱体路线;在几分钟内按实验室约束定制单层 MoS2、MoSe2、WS2 生长方案。
  • 论文验证:30 位领域专家对端到端生成论文给出 450 份评审,可靠性模块降低了幻觉与抄袭出现。 🔗 论文

5️⃣ Grok Bot 上线模板分享与在线购物,多 Agent 协作走向“组织化”#

  • 模板共享:Grok Bot 支持用户把 Bot 模板分享给他人;开发者已做出“项目经理 Bot”来管理多个专家 Bot。
  • 交易闭环:通过 Stripe Link 关联卡片后,Grok Bot 可在互联网上完成真实购买。
  • 团队实践:官方指南库收录了 6 个 Bot 运营手游工作室、销售团队 Bot 编制、PM 管理 5 个工程 Bot 等案例,Handoffs(Bot 间移交)成为关键机制。 🔗 Grok Bot 模板公告 | 官方指南库

6️⃣ Perplexity Search API 登顶 Artificial Analysis 搜索指数#

  • 榜单表现:Artificial Analysis Search Index 首次纳入 Perplexity Search,三个上下文变体占据前三,最高 80 分,领先 Parallel 与 Brave 的 75 分。
  • 成本优势:单任务模型推理成本为 0.028−0.028-0.034,是当前测试过的最低水平;总成本约 $0.091,处于中游延迟。
  • 搜索竞争:轻量化的搜索结果减少了模型阅读量,使 Perplexity 在保持搜索质量的同时压低调用成本。 🔗 Artificial Analysis 数据

7️⃣ AI 让漏洞披露演变为分钟级攻击,开源维护流程承压#

  • 现象:剑桥教授 Anil Madhavapeddy 报告,OCaml 安全补丁在公开讨论约 10 分钟后,网站即遭 path traversal 探测;他自己的 agent 也能复现类似利用。
  • 维护者证词:rclone 维护者 Nick Craig-Wood 称过去 10 年通过 GitHub 收到约 20 份安全披露,近一个月超过 40 份,其中约 75% 有实质问题;GitHub 分配 CVE 从 2-3 天延长到 3-4 周。
  • 开源流程冲击:现有 embargo 机制在“分钟级利用”面前失效,社区需要重新设计漏洞披露与修复节奏。 🔗 Simon Willison 博客 | HN 讨论

8️⃣ JetBrains Cadence 遭入侵:TeamCity 漏洞未及时修补,客户数据暴露#

  • 事件:JetBrains 确认 Cadence 云服务被未授权访问,根因是 TeamCity 的 CVE-2026-63077 未按预期打补丁;受影响时间为 8 月 8 日至 24 日。
  • 影响范围:用户名、姓名、邮箱、最后登录时间与 IP 被提取;2024 年完整备份及多个 AWS IAM 凭据泄露,PyCharm 同步的源代码可能被访问。
  • 用户行动:需立即轮换所有 Cadence 执行涉及的凭据,将所有执行输入/输出视为不可信,并审计关联云账户与仓库活动。 🔗 JetBrains 安全公告

9️⃣ MiniMax Fast H3 v1 开源:15 秒 768p 视频 13 秒生成#

  • 发布:Hao AI Lab、Nuva Lab 与 NVIDIA FastGen 联合发布开源权重 FastH3 v1,基于 MiniMax H3,在 NVIDIA Blackwell GPU 上最高获得 14 倍加速。
  • 协同设计:MiniMax 官方称这是开放后训练与硬件协同设计的成果,社区可完整复现加速配方。
  • 行业意义:开源视频模型的后训练开始成为独立赛道,模型架构、训练配方与硬件优化正在被打包交付。 🔗 Hao AI Lab 公告 | MiniMax 转发

🔟 OpenAI 发布 Rosalind Workbench,科学 Agent 走向可审查工作流#

  • 功能:Rosalind Workbench 将蛋白质结构与序列分析、测序流程等科学计算接入专用模型与工具,并输出可审查结果。
  • 定位:这是 OpenAI 在科学 Agent 领域少有的平台化产品,把手动科研流程变成模型、工具与人工验收共同驱动的工作流。 🔗 OpenAI 开发者博客

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
abhigyanpatwari/GitNexusAI Agent / 代码知识图谱46.2k
abi/screenshot-to-codeAI 生成式开发工具75.5k
ChromeDevTools/chrome-devtools-mcpAI Agent / MCP 工具链50.0k

1. abhigyanpatwari/GitNexus ⭐ 今日 +202#

语言/许可: TypeScript / PolyForm Noncommercial
总 Stars: 46.2k
仓库: GitHub

项目定位:
面向 AI 编码 Agent 的代码知识图谱引擎,将仓库结构预计算为可查询图谱,通过 MCP 暴露给 Claude Code、Cursor 等工具,减少 Agent 因不了解跨文件依赖而产生的错误编辑。

核心功能:

  • 本地索引 Git 仓库,构建函数、调用链、依赖关系的知识图谱
  • gitnexus analyze 一键生成 AGENTS.md / CLAUDE.md 上下文文件并注册 Agent hooks
  • MCP server 连接主流编码 Agent,提供结构感知的代码检索能力
  • 浏览器端 Web UI 支持图谱可视化和 Graph RAG 问答

技术亮点:
基于 Tree-sitter 做多语言解析,数据层使用 LadybugDB(本地原生 / WASM 两种模式);通过预计算图谱而非实时图遍历降低 LLM 推理成本。注意其为非商业许可。


2. abi/screenshot-to-code ⭐ 今日 +326#

语言/许可: Python / MIT
总 Stars: 75.5k
仓库: GitHub

项目定位:
将截图、Figma 设计稿、屏幕录制自动转换为前端代码的原型生成工具,面向快速搭建 UI 和设计稿落地的开发者。

核心功能:

  • 支持 HTML+Tailwind、React、Vue、Bootstrap、Ionic 等多种输出栈
  • 可切换 Gemini / OpenAI / Claude 多模型对比生成结果
  • 从截图中提取真实图片与 logo 资产并复用
  • 屏幕录制转可交互 HTML 原型

技术亮点:
FastAPI + React/Vite 架构,支持 Docker 一键部署;提供 OpenAPI/Replicate 接口的扩展集成,并内置 Playwright 截图预览进行视觉校验。


3. ChromeDevTools/chrome-devtools-mcp ⭐ 今日 +67#

语言/许可: TypeScript / Apache-2.0
总 Stars: 50.0k
仓库: GitHub

项目定位:
Google Chrome 官方出品的 MCP server,让编码 Agent 能够直接控制、检查和调试真实 Chrome 浏览器,用于前端自动化、定位缺陷和性能分析。

核心功能:

  • Agent 可操作浏览器:导航、点击、截图、DOM 查询
  • 捕获网络请求、控制台日志(含 source-map 堆栈还原)
  • 录制 Chrome trace 并提取性能瓶颈,可对照 CrUX 真实用户数据
  • 提供 --slim 模式专门处理轻量级浏览器任务

技术亮点:
基于 Puppeteer 实现可靠自动化,自动化动作后同步等待结果;工具面覆盖 DevTools 协议,适合作为 Agent 的前端验证与调试闭环。

🟧 Hacker News 热议#

Judge rules Trump administration’s blacklisting of Anthropic was illegal#

496 pts · 359 comments · nytimes.com

📌 内容总结

  • 背景: 联邦法官裁定特朗普政府将 Anthropic 列为”国防供应链风险”、禁止联邦机构及承包商使用其模型的行为非法,构成对政府批评者的报复。起因是 Anthropic 在合同中禁止政府将模型用于无人类干预的自主武器和美国人大规模监控场景——该政策自 2024 年起已存在,并非专门针对政府。
  • HN 关注点:
    • 行政记录仅一份四页备忘录,且晚于三项被诉行动中的两项;政府最终放弃”Anthropic 拥有已部署系统后门访问权限”的核心风险指控,承认其技术与其他”黑盒” AI 模型风险相当。
    • 法官关键表述:“The empty invocation of national security is not a blank check to punish and retaliate against government critics.”
    • 本案是两起独立诉讼之一;本次判决不构成先例,第二起诉讼仍在进行。

💬 讨论总结

  • 法律共识: 黑名单远超”不选择供应商”——它禁止了整个政府及承包商的采购使用,是惩罚性手段;行政记录过薄、政府撤回核心技术指控,使报复意图成为法官判断的关键。
  • 执行现实: “能赢官司,赢不了过程”是多条评论的底色——判决来得慢、赔偿难以追索、违宪行为在诉讼期间已造成实际损害。但也有反驳实例:IEEPA 关税被最高法院裁定非法后,1660 亿美元退还进口商。
  • 商业与战略: 黑名单期间 OpenAI 在 enterprise 客户上完成追赶(“Mythos 被禁的窗口期”);解除后国防承包商恢复与 Anthropic 合作的空间。有评论认为”AI 种族隔离”叙事反而推动各国主权 AI 与中国模型采用。
  • 反对意见(少数): Anthropic 对政府设限却无法阻止普通用户同等使用模型,构成”事实上的国家安全风险”;DoD 采购裁量权应受尊重。 replies 反驳:Anthropic 的两条红线不是普通用户能触及的能力范围,且”国家安全风险”是被政治化的虚构叙事。
  • 制度背景: SCOTUS 构成与行政令治理被反复讨论;多位用户提醒先例未定,上诉和第二起诉讼的结果才是关键变量。

🔗 原文 · HN 讨论页

GLM-5.3 is now open-weight#

563 pts · 199 comments · huggingface.co

📌 内容总结

  • 背景: 智谱发布 GLM-5.3 开放权重模型,基座与 5.2 相同,全部提升来自 post-training。官方称其为最强开源编码模型,自研 Z.ai Code Bench 提升 50%,Terminal Bench 3.0 从 4.6 升至 28.3。
  • HN 关注点:
    • “Emergent Cyber Capability”:CyberGym 84.5 为开源 SOTA;ExploitGym(2h/6h)105/130 vs 5.2 的 29/39,官方明确将漏洞利用能力作为卖点。
    • 全量版本使用 FP8 专家,756GB,约为 5.2(1.51TB BF16)一半体积;支持 reasoning_effort(low/high/max,默认 max)。
    • 生态支持广:SGLang、vLLM、KTransformers、Unsloth、TokenSpeed、Ascend NPU 均可部署;评估脚注详细披露 harness、超时、TPS 缩放方法。

💬 讨论总结

  • 共识 / 实测: “感觉像 Opus 4.8”——多名用户给出接近闭源前沿模型的评价;Flash 版本在 Q3 量化下通过全部私有测试;“GLM 5.3 Flash 是我用过最好的模型”。也有用户指出官方 API 速度不稳定。
  • 工程经验: FP8 专家使全量体积减半,是本地部署可行性的关键;有用户在双 DGX Spark 上跑 Flash,认为优于 DeepSeek-V4-Flash 且”具备 DS 缺乏的直觉”。5.3 的 thinking token 效率改善被长期处理复杂数据分析的用户视为重点——此前 Qwen3.8/GLM-5.2 的思考开销是 Opus/GPT 的 3-4 倍。
  • 商业现实: Flash 官方价 0.50/M(临时五折)与DeepSeek−V4−Flash的0.50/M(临时五折)与 DeepSeek-V4-Flash 的 0.48 几乎持平;独立测试 10 个任务总延迟 108s vs 154s 更优。本地部署路径明确:512GB Mac M5 Ultra 或二手 Epyc 服务器,“1/5 价格、1/5 速度”。
  • 风险/限制: 开放权重 + 顶尖漏洞利用能力引发安全担忧——“人类可能没准备好”。主流反驳是 1990 年代加密出口管制类比:攻击者早已在做垂直微调,开源防御模型是必要之盾。全量版无 vision 是部分用户的 deal breaker。
  • 竞争判断: 有评论者确认此前匿名模型 “Ox-Alpha” 即 GLM-5.3-Flash,认为开源侧已对 Anthropic/OpenAI 构成实质压力;但 AWS Bedrock 引入前景不被看好——企业对中国训练模型仍有顾虑。

🔗 原文 · HN 讨论页

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment#

74 pts · 16 comments · arxiv.org

📌 内容总结

  • 背景: 论文提出 “Station”——开放世界多智能体环境:来自不同模型家族的 agent 在无中心协调、无脚本 pipeline 的情况下自主选择研究方向、协作实验、构建共享文献。
  • HN 关注点:
    • AlphaEvolve 目录 12 个构造问题中 5 个取得文献中不存在的新结果:有限域 Kakeya 集新无限族、11 维 604 点 kissing 构型、discretized Kakeya needle 与 sign uncertainty 新纪录、Erdős 最小重叠问题下界改进、Book Ramsey 数新无限族。
    • Agent 不仅产出数值构造,还给出解释构造原理的定理与分析;原始对话、证明、验证代码全部开源。

💬 讨论总结

  • 共识: 这直接回应了”AI 只做 benchmark、不做原创数学”的批评——新结果、可解释定理、完整验证材料三者齐备。
  • 反驳 / 澄清: 一条关键评论指出原批评常被误读——专业数学家指的不是”是否新”,而是 AI 的优势本质是海量记忆 + 快速重组已知方法;这功能上等价于某类创造力,但可能是非穷尽式形式。定义问题仍未解决。
  • 工程经验 / 设计: 多模型家族互评、无中心协调、定期”放假”并接收随机提示以鼓励开放式思考——被调侃为”为 AI 重新发明了剑桥高级公休室”。有评论建议将奖励结构内生(自建奖项、期刊、声誉系统、算力分配),与外部验证器对比作为自然实验。
  • 限制: 单个 agent 受上下文窗口限制寿命不长,难以积累人类式的长期声誉信号,内生机构可能因此失效或产生 herding。

🔗 原文 · HN 讨论页

1,897 字
晚报 | EVENING 2026-08-29

OpenAI 终止与 Cursor 合作,GLM-5.3 与 Hy4 接入生态

今日要点
  • OpenAI 终止向 Cursor 供模,11 月 12 日生效
  • GLM-5.3 与 Flash 上线 Fireworks/Ollama
  • 腾讯 Hy4 压缩至约 200GB GGUF
OpenAI 以控制权变更条款为由终止向 Cursor 供应模型,11 月 12 日生效;Cursor 回应称 OpenAI 模型约占其流量 5%。智谱 GLM-5.3 上线 Fireworks/Ollama,腾讯 Hy4 量化至约 200GB。

1️⃣ [持续跟踪] OpenAI 终止与 Cursor 合作,Anthropic 与 Replit 分别表态#

  • 核心亮点:Cursor 被 SpaceX 收购后,OpenAI 援引合同中的控制权变更条款,宣布于 11 月 12 日终止对其直接供应模型。
  • 前情提要:SpaceX 以 600 亿美元完成对 Cursor 的收购,触发 OpenAI 合同中的控制权变更条款;OpenAI 选择在合同允许的最后期限执行解约。
  • 最新进展:OpenAI 官方声明无法确信 SpaceX 旗下公司会遵守服务条款,并列举马斯克相关公司的历史违约记录,包括马斯克在 4 月庭审中承认 xAI 曾蒸馏 OpenAI 模型。
  • 多方回应:Cursor CEO Michael Truell 称 OpenAI 模型约占 Cursor 流量的 5%,正与 OpenAI 协商;Anthropic 联合创始人 Tom Brown 表示自 Sonnet 3.5 时代起 Cursor 就是可信伙伴,将继续增加算力支持 Cursor 中的 Claude;Replit CEO 则宣布可免费使用 OpenAI 模型,并愿资助企业从 Cursor 迁移。
  • 开发者影响:11 月 12 日后 Cursor 订阅内的 GPT 模型选项将消失,用户仍可自带 OpenAI API key 或通过 Codex 插件继续调用。

🔗 OpenAI 官方公告 | Cursor 回应 | Anthropic Tom Brown 表态 | Replit CEO 回应

2️⃣ [持续跟踪] GLM-5.3 接入 Fireworks/Ollama,MaaS 许可设百亿美元门槛#

  • 核心亮点:智谱 GLM-5.3 开源一天后,Fireworks 与 Ollama 完成服务接入,同时新增针对大型 MaaS 服务商的商业使用前置审查条款。
  • 前情提要:智谱开放 GLM-5.3 的 FP8/BF16 权重,能力提升主要来自后训练;Terminal-Bench 3.0 由 4.6 升至 28.3,DeepSWE v1.1 由 46.2 升至 66.9。
  • 最新进展:Fireworks 宣布 GLM-5.3 上线,称其在 Z.ai Code Bench 上较 5.2 提升 50%,并强调网络安全任务上的开源权重表现领先;Ollama 云端全面推出 GLM-5.3 与 GLM-5.3 Flash,支持 Claude Desktop、OpenCode 等 harness 调用。
  • 许可变化:新许可证允许商业使用与再许可,但连续 12 个月收入超过 100 亿美元的 MaaS 服务商须先通过智谱安全审查;终端产品嵌入与单纯转发模型请求除外。
  • 周边动态:GLM-5.3-Flash 在 Fireworks 转 GA,官方解释曾因无法解释的推理长度差异推迟两天上线;Terminal-Bench 4.0 同日发布。

🔗 Fireworks 上线 GLM-5.3 | Ollama 云服务 | GLM-5.3-Flash GA

3️⃣ [持续跟踪] 腾讯 Hy4 preview 接入 Cline/OpenCode,GGUF 压缩至约 200GB#

  • 核心亮点:腾讯 Hy4 preview 的生态接入与低比特量化同日铺开,1.5TB 权重被压缩至约 200GiB,多项评测精度几乎不变。
  • 前情提要:腾讯昨日开源 Hy4 preview,770B 总参数 / 49B 激活,1M 上下文,在 SWE-bench Pro 等编码基准上表现领先。
  • 最新进展:Cline 与 OpenCode Go 均已支持 Hy4 preview;腾讯发布 MIX-STQ1_0 量化方案,MCP Atlas 83.7→83.2、SWE-Bench multi 82.9→81.3、MRCR 81.3→81.1、IFBench 73.5→72.5。
  • 技术要点:量化位宽由校准数据逐层决定,部分层低至 1.31-bit STQ1_0,部分层保持 2.06-bit IQ2_XXS,在同等体积下降低误差。
  • 观察:Hy4 与 GLM-5.3 在相近时间铺开开源生态,并快速接入 Cline、OpenCode、Ollama、Fireworks 等工具链,开源模型在 Agent harness 层的可替换性正在提升。

🔗 腾讯 Hy4 量化公告 | Cline 接入 | OpenCode Go 接入

4️⃣ Anthropic 案例披露:Warp 用人类评论闭环改进 Agent Skill#

  • 核心亮点:Claude 官方博客介绍 Warp 如何构建自我改进的 Code Review Agent,核心不是让模型自己改自己,而是根据人类工程师在 PR 上的真实评论更新 Skill。
  • 问题背景:Agent 不了解项目上下文、团队规范和历史经验教训,单靠系统提示词与 AGENTS.md 难以持久改进。
  • 具体机制:一个基础 Skill 执行代码审查,另一个改进 Skill 定期收集人类对审查结果的评论,低摩擦地自动形成修改建议。
  • 最佳实践:写原则而非死规则;解释规则背后的原因;让反馈发生在原有工作流中;保持 Skill 精简并渐进披露;高质量领域反馈比大量浅层反馈更有效;改进 Skill 本身可以复用于其他 Skill。
  • 意义:改进开始来自模型外围的 harness、数据与反馈闭环,而非单纯替换模型骨干。

🔗 Claude 官方博客 | 宝玉解读

5️⃣ Andrew Ng 发布 AI 工程技能图谱:软件工程基础转向“决策与驾驭”#

  • 核心观点:Agent 会替你写代码,但会在延迟、一致性、成本等维度做出默认权衡;专业能力在于知道权衡菜单,并引导 Agent 选择适合系统的方案。
  • 五大模块:全栈应用、数据管理、系统架构、安全与可靠性、规模化与生产运维。
  • 重点论述:数据管理是最不可逆的部分,AI 系统的上下文直接来自数据源,数据架构错误会被静默放大;“为 Agent 而建的数据基础设施”是快速演进的新领域。
  • 对开发者:先用 Agent 写代码,再用自己的判断去审查每个方案在延迟、成本、一致性上的取舍。

🔗 Andrew Ng 原文 | 详细解读

6️⃣ UC Berkeley/MIT 开源 FreeToken:MoE 推理下沉消费级硬件#

  • 核心亮点:FreeToken 是一个面向 Mixture-of-Experts 模型的开源推理引擎,通过动态调度策略和权重管理优化,让前沿 MoE 模型在消费级硬件上可用。
  • 细节:项目提升解码速度与执行效率,面向边缘 AI 和自托管推理系统。
  • 意义:在 open-weight 模型体积持续扩大的同时,推理层正在尝试用调度与压缩抵消硬件成本。

🔗 InfoQ 报道

7️⃣ Meta 内测个人 AI 智能体 Hatch,后台代办购物与预约#

  • 核心亮点:Meta 将代号 Project Hatch 的个人 AI 智能体开放给员工测试,可在 App 关闭后继续在后台运行。
  • 能力:独立计算环境,可填写表单、购物、深度研究,并连接邮箱、日历、Spotify、Instagram 与 OpenTable;用户可自定义名称、说话方式与关注重点。
  • 边界:敏感操作需要用户确认;尚未公布正式上线时间与收费方式。

🔗 爱范儿早报

8️⃣ 蚂蚁发布金融增强模型 Ling-3.0-flash-Fin,下周开放权重#

  • 核心亮点:蚂蚁百灵发布首个金融增强模型 Ling-3.0-flash-Fin,采用 MoE 架构,124B 总参数 / 5.1B 激活。
  • 能力设计:通过金融语料持续预训练、领域后训练和工具使用优化,将投资研究拆解为信息检索、研究推理、估值建模与研报撰写四类能力。
  • 演示案例:可读取财报,并将含 7 张工作表、5000 余个公式的 Excel 模型从预测数据更新为实际披露数据。
  • 开放计划:已在 OpenRouter 提供免费体验,权重下周开放;官方提醒关键假设、估值结果与投资结论仍需专业人员复核。

🔗 爱范儿早报