Notion 接入 GLM 5.3 与 DeepSeek V4.1 Flash,Google 发布 Android Bench 2.0
- Notion 接入 GLM 5.3 与 DeepSeek V4.1 Flash,新增工作区默认 Agent 指令
- Google 发布 Android Bench 2.0,30 个任务最高通过率 28%
- GPT-6 Astra 解出 1918 年德军 ADFGVX 密文
Notion 将 GLM 5.3、GLM 5.3 Flash 与 DeepSeek V4.1 Flash 接入 Personal 与 Custom Agents,并支持为整个工作区设置默认 Agent 指令;Google 发布 Android Bench 2.0,用 30 个任务评测模型+专属 Coding Agent,最高通过率 28%;Hacker News 上 GPT-6 Astra 解出 1918 年德军 ADFGVX 无线电密文。
1️⃣ [持续跟踪] Jev 生态:OpenRouter 发布 Ori Eval,实测决策模型速度优势#
- 前情提要:Jev 由 TypeSafe AI 发布,定位不逐 token 生成的结构化决策模型,发布后社区出现多个复刻,Browser Use 等已实测低成本落地。
- 最新突破:OpenRouter 发布 Ori Eval,可一键评估项目适配的最佳模型;实测 Jev 比次快模型快 5 倍,最慢请求仍优于其他模型中位数。
- 开发者动向:elvis 将 Jev 作为基础原语接入自建 Agent 框架,用于降本提速、动态工作流与上下文按需调用;a16z 的 Justine Moore 测试 Jev 与 GPT-5.6 预测书籍偏好,称 Jev 略准、便宜 53 倍、快 25 倍。 🔗 OpenRouter Ori Eval | OpenRouter 实测 | elvis 推文 | Justine Moore 测试
2️⃣ 朱啸虎:产业层面无 AI 泡沫,基础大模型今年是最后一年#
- 核心判断:金沙江创投朱啸虎在腾讯新闻深网访谈中称,产业层面没有 AI 泡沫,算力中心建好不愁卖,泡沫在个别高估值公司。
- 模型层终局:今年可能是基础大模型的最后一年,明年需要讲新故事;API 是危险生意,终局是水、电等公用事业,对应 10%–20% 毛利。
- 应用层判断:办公 Agent 是大厂天下,创业公司只能选平台打工;AI 应用看增长率和执行力,20% 月增长是基本要求。 🔗 腾讯新闻深网访谈精编
3️⃣ AI Engineer 推理工程专场:基准失真与成本核算成为焦点#
- 基准问题:某基准工具被要求跑 200 queries/s,实际跑 38 却报告 200;Google 讲者讨论 LLM 性能基准是否可靠。
- 成本核算:Meta 按“每成功任务成本”而非每 token 衡量推理;OpenAI 用全局优化器替代反馈回路路由,避免流量在热引擎与冷引擎之间震荡。
- 工程实践:FriendliAI 称同一编码 Agent 在开源权重模型上成本约为闭源前沿模型的 1/5.5;Red Hat 演示 KV 缓存命中使首请求从 3 秒降至 1 秒。 🔗 AI Engineer 推理专场 | 推理专场笔记
4️⃣ MIT 与 Sakana AI 发布 SIFT:自改进编程智能体算力降至 DGM 十分之一#
- 方法:Self-Improvement via Fast Tree-search(SIFT)通过 LLM judge 先筛选候选自我修改,只评估有希望的候选,降低 benchmark 评估瓶颈。
- 数据:在 Polyglot 上,o3-mini 经 30 次扩展达 35.1%,DGM 经 80 节点达 30.7%;SIFT 全程低于 50 CPU 小时、低于 5 小时 wall clock。
- 成本:Qwen3-30B 配置完整搜索 224 CPU 小时、34 美元 API 花费,约为 DGM 基线的十分之一;TerminalBench 上 gpt-5.4-high 作为 pairwise judge 找到 36.7% 的 agent。 🔗 elvis 推荐 | 论文
5️⃣ Google 推出 Android Bench 2.0:模型+Agent 真实 Android 开发基准#
- 评测对象:模型搭配其专属 Coding Agent,如 GPT + Codex、Claude + Claude Code、Gemini + Antigravity、Kimi K3、Qwen 3.8 Max。
- 任务覆盖:30 个任务覆盖应用转换、从零构建、架构迁移(XML→Compose、Hilt→Koin、Retrofit→Ktor、Java→Kotlin)与新功能开发。
- 结果:最高通过率 28%,GPT 6 Astra + Codex、Claude Fable 5.1 + Claude Code 前两名;两个跨平台转换任务与大量 XML→Compose 迁移所有模型 0/5,GPT 6 Astra 在 Habo 上完成度 99% 却未通过。 🔗 meng shao 推文 | Android Bench 官方
6️⃣ 华为汪涛:AI 算力底座不能只靠一颗芯片,CANN 跨过拐点#
- 核心观点:华为要打造 AI 算力底座,只做好一颗芯片远远不够,软件生态是补全关键。
- 进展:CANN 跨过拐点,华为补上软件生态。
- 行业意义:与昇腾 960 提前至明年一季度、超节点扩至 4096 卡等硬件进展相呼应,国产 AI 算力竞争进入芯片与软件栈协同阶段。 🔗 量子位报道
7️⃣ Notion 接入 GLM 5.3 与 DeepSeek V4.1 Flash,新增工作区默认 Agent 指令#
- 模型接入:Notion 官方宣布 Personal 与 Custom Agents 中新增 GLM 5.3、GLM 5.3 Flash、DeepSeek V4.1 Flash 等开放权重模型。
- 管理功能:支持为整个工作区设置默认 Agent 指令(House rules for your agents),统一控制 Agent 行为。
- 行业意义:主流生产力工具开始将开放权重模型作为 Agent 可选项,并强化企业级 Agent 治理。 🔗 Notion 接入 GLM | 接入 DeepSeek V4.1 Flash | 工作区默认指令
8️⃣ Codex 内置浏览器支持导入插件与 Cookie#
- 功能更新:Codex 内置浏览器已支持导入插件和 Cookie,功能接近完整浏览器。
- 影响:第三方浏览器创业团队面临压力,AI 编码工具向通用浏览器与自动化入口扩展。
- 背景:此前腾讯开源 BrowserSkill 让 Agent 借用用户已登录的真实浏览器标签页,浏览器作为 Agent 执行环境的竞争加剧。 🔗 向阳乔木推文
9️⃣ LinkedIn 分享基于 MCP 的上下文工程:提效 20%,可靠性无损#
- 方案:LinkedIn 构建 Contextual Agent Playbooks and Tools,基于 Model Context Protocol(MCP),为编码 Agent 提供程序记忆、代码搜索和 runbooks。
- 结果:在大型代码库中实现 20% 生产力提升,且零可靠性损失。
- 架构:分享架构细节与运营护栏,用于克服 AI Agent 在大代码库中的局限。 🔗 InfoQ 演讲
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| trycua/cua | AI Agent / Computer-Use | 24.4k |
| cactus-compute/needle | 端侧模型 / 边缘 AI | 11.6k |
| higgsfield-ai/higgsfield | AI 基础设施 / 分布式训练 | 4.9k |
1. trycua/cua ⭐ 今日 +859#
语言/许可: HTML / MIT
总 Stars: 24.4k
仓库: GitHub
项目定位:
面向 computer-use Agent 开发者,提供跨 OS 桌面驱动、隔离云桌面/本地 VM 与基准测试,解决 Agent 在真实 GUI 中缺少可复现操作环境和评测闭环的问题;与仅覆盖浏览器自动化的方案相比,覆盖原生应用、多操作系统和训练数据生成。
核心功能:
- 跨 macOS / Windows / Linux 的桌面驱动,支持 CLI、MCP、类型化 SDK 接入,让 Agent 检查并操作原生应用与浏览器。
- 云端隔离桌面集群(Fleets)与本地 macOS / Linux VM(Lume),通过 Sandbox SDK 统一管理命令执行、截图与资源生命周期。
- Cua Bench:创建 computer-use 任务、运行参考解、评估 Agent 并导出轨迹,用于训练和评测。
- CUA-S1:面向 computer-use 决策的小型专用模型族,提供源码、合成数据生成、训练与评估组件。
技术亮点:
基于 Apple Virtualization.Framework 的本地 macOS VM;支持后台交付操作而不抢占指针或焦点;通过 MCP 集成与轨迹导出,面向跨代码、API 与 GUI 的 Computer-Use 2.0 任务流。
2. cactus-compute/needle ⭐ 今日 +234#
语言/许可: Python / Apache-2.0
总 Stars: 11.6k
仓库: GitHub
项目定位:
面向手机、可穿戴、机器人、汽车和微控制器的端侧 AI 开发者,提供 8–29 MB 的自动化基础模型,在本地完成工具调用、结构化抽取和文本嵌入;与依赖云端大模型的方案相比,牺牲通用聊天能力,换取小体积、低延迟和可离线部署。
核心功能:
- Tool calls:给定应用暴露的函数,选择正确工具并按顺序填充参数;无匹配工具时返回空列表而非猜测。
- Structured extraction:按 schema 输出类型化字段,字节级 grammar 约束保证结构化输出可解析。
- Text embedding:同一模型输出句向量,用于本地搜索、匹配和路由。
- 支持本地微调、LoRA 导出与多平台引擎部署,权重和推理引擎发布在 Hugging Face。
技术亮点:
2-bit 量化到 8–29 MB 单二进制;Laddered Simple Attention Network、Monarch Hadamard MLP、GQA、engram n-gram memory;2.125 bits/weight 的 .cact 格式;微调后的 29M 参数子网络可超过部分更大基线。
3. higgsfield-ai/higgsfield ⭐ 今日 +196#
语言/许可: Jupyter Notebook / Apache-2.0
总 Stars: 4.9k
仓库: GitHub
项目定位:
面向需要多节点 GPU 训练 LLM 的团队,提供容错 GPU 编排与 PyTorch/DeepSpeed 训练框架,解决资源分配、分布式训练启动、环境复现和队列管理问题;与手动 SSH、Docker、YAML 拼装方案相比,把部署与运行链路收敛到实验接口和 GitHub Actions。
核心功能:
- GPU 工作负载管理:为训练任务分配独占或非独占节点,并用队列管理资源竞争。
- 支持 ZeRO-3 DeepSpeed API 和 PyTorch FSDP,面向十亿到万亿参数模型的分片训练。
- 提供
@experiment装饰器等接口,统一启动、执行和监控大规模神经网络训练。 - 与 GitHub / GitHub Actions 集成,支持实验代码部署、环境版本固定和检查点保存。
技术亮点:
将多节点环境安装、Docker、SSH、部署密钥和运行工作流自动化;抽象掉大量训练参数与 YAML 配置,同时保留 PyTorch、DeepSpeed、Accelerate 兼容路径。
🟧 Hacker News 热议#
I built non-autoregressive decision models with RL a year ago#
1052 pts · 247 comments · convaiinnovations.com
📌 内容总结
- 背景/作者意图:作者称 2025-03 已用 PPO 在序列表示上做销售转化概率预测并公开论文/权重/数据;2026-09 TypeSafe AI 发布 Jev 后同类概念被当作新突破,于是把旧工作泛化为开源 Laya,定位为快速、校准的 System 1 决策引擎。
- HN 关注点:
- 架构:双向编码器单次前向;三种原语
choice/score/noul;输出概率/分数,不生成文本,因此不存在 schema 违规和文本幻觉。 - 性能与成本:单 GPU 32.8ms,批量 7.2ms/问题;三个 checkpoint(ModernBERT-large、mmBERT-base、typed-decisions);100+ 语言;Apache 2.0,自托管零 API 成本。
- 对比 Jev:typed-decisions 0.766 vs 0.727,AG News 0.950 vs 0.910,ECE 0.081 vs 0.246,P50 延迟 32.8ms vs 236–276ms;多语言路由覆盖 45/51。
- 多语言路由:英语 checkpoint 在 Khmer 上 0.000 准确率但 0.952 置信;置信门控无法提示脚本不匹配,必须在 forward 前决定用哪个模型。
- 限制:choice 超过 20 项退化(Banking77 0.425 vs Jev 0.870);零样本约 0.35,0.766 来自微调;温度标定把 ECE 从 0.466 降至 0.081;上下文 512–1024,部分多语言最多 8k。
- 架构:双向编码器单次前向;三种原语
- 实际结论:作者将 Laya 定位为需专门微调的高速基础模型,用于分类、护栏、路由、工单分流;不是通用零样本模型,也不是通用 reasoning 替代品。
💬 讨论总结
- 主要共识:这不是新范式。多位评论者把它类比为 BERT/传统分类器加更多数据、RL 标定和产品化包装;零样本 NLI、GLiNER、OpenDecision 等更早或并行出现。
- Jev 与 Laya 的能力争议:有用户称 Jev 在分类任务上比 Gemini Flash Lite 更便宜更快且一致;反方称“frontier”证据不足,举出草莓 R、掷骰/硬币概率异常、答案顺序敏感、自称 Qwen 等。对 Laya 的掷骰/硬币测试也出现无意义概率,说明“不生成文本”不等于概率校准。
- 产品化与分发:Jev 的优势被归因于品牌、System One 叙事、清晰接口和托管 API;不少用户不愿自管 GPU、维护语料和重训,愿意为 always-on pay-per-use 付费。Laya 开源但自托管,限制即插即用。
- 工程限制被反复指出:上下文 512–1024 对 Jev 的 32k/64k 是明显差距;>20 选项退化;zero-shot 约 0.35 且 0.766 靠微调,被质疑是 fine-tuned Laya 对比 zero-shot Jev;温度标定非默认。Unicode 路由被视为补丁,因为置信度不能提示模型读不懂文字。
- 历史与署名:评论者对作者有同情,但批评“发布 arXiv 就该被看见”的想法幼稚;传播、营销和产品定义本身就是突破的一部分。也有人认为公开研究常被私人产品化,Jev 可能只是公开思路的商品化。
- 运维/生态需求:出现 CPU 推理、hosted API、Excel 插件、视觉扩展、per-token BERT 式云服务等诉求;已有 OpenDecision、hallunox、openjev、laya-jolt、laya-vision 等复现或封装。
- 元讨论:评论区质疑 landing page 和部分发言像 LLM 生成,甚至怀疑刷票;System 1/2 术语也被质疑——LLM 同为深度学习,System 2 原本更接近符号推理。
Show HN: CUA-S1 – A System One Model for Computer Use#
56 pts · 7 comments · github.com/trycua
📌 内容总结
- 作者想做什么:Cua 提供开源桌面自动化、云桌面、本地 macOS VM、专用决策模型和评测;CUA-S1 是面向 computer-use 的小型 System 1 模型家族,首个 profile 只做 forms,对结构化 UI 元素和文档值做打分决策,而不是逐 token 生成。
- 关键要点:
- Cua 栈包括:Cua Fleets 云桌面、Cua Driver 操作 macOS/Windows/Linux 原生应用和浏览器、Lume 基于 Apple Virtualization.Framework 的本地 macOS/Linux VM、Cua Bench 任务评测与轨迹导出。
- Driver 支持 CLI、MCP、typed SDK;在平台支持时后台投递动作,不移动指针/抢焦点;平台边界见文档。
- CUA-S1 源码含 Python 模型代码、合成数据生成、训练和评估;GitHub 是早期 source-only research release,权重放在 Hugging Face,源码 MIT,第三方组件各有许可证。
- 项目提出 “Computer-Use 2.0”:同一任务中在代码、API 和 GUI 间切换。
- 实际结论/限制:System 1 仅指快速、有边界的决策,不替代通用 agent 的规划/推理;当前只聚焦 forms;每个模型和数据集需查 model card 的范围、限制和许可证。
- HN 关注点: 本数据未提供评论内容,无法归纳社区关注点。
💬 讨论总结
- 输入中
top_comments为空,无法提炼 HN 社区观点;评论数 7 但未提供正文。
GPT-6 Astra Solves a WWI German Radio Cipher#
360 pts · 166 comments · prinzai.com
📌 内容总结
- 背景/作者意图:作者查看 scienceblogs 的 50 个未解密码列表,选取一封 1918-11-27 的德军 ADFGVX 无线电密文(第 217 页),并称 GPT-6 Astra 解出该密文。
- 关键要点:
- ADFGVX 用 6×6 表,行/列标签为 A,D,F,G,V,X;密钥决定表内容和列换位。文中用 “HOUSE” 示例:PRINZ -> FX GD DX FV VD。
- Astra 提出的密钥为 “TRUPPENVERSCHIEBUNG”,来自 J. Rives Childs 书中 pp.214–215。解密时先按字母序重排密钥,再将密文按 19 字符一行写在密钥下,按列序读出。
- 解出的德文大意:一艘英国巡洋舰抵达塞瓦斯托波尔,日期为
?4日;一支盟军分舰队于 26 日跟进。 - 交叉验证:HMS Canterbury 原始日志显示其于 1918-11-24 抵达塞瓦斯托波尔;盟军分舰队于 11-26 抵达。
- 时间矛盾:该密钥据称从 1918-12-09 开始使用,而密文发于 11-27;原因未知。作者表示此前未见过该密文被解出,将其作为小型结果分享。
- 实际限制:结果依赖历史密钥表和模型假设,日期仍有
?4未定,密钥启用日期与发送日期的冲突未解决。 - HN 关注点: 本数据未提供评论内容,无法归纳社区关注点。
💬 讨论总结
- 输入中
top_comments为空,无法提炼 HN 社区观点;评论数 166 但未提供正文。
Anthropic 推进 2 万亿美元 IPO,Meta 开放 Muse 连接器
- Anthropic 推进 2 万亿美元 IPO,预计年化营收超千亿美元
- Meta Muse 登顶美国 App Store,Zuckerberg 开放连接器
- Hacktron 披露攻破 OpenAI 攻击链,libheif 漏洞波及多家公司
Anthropic 推进 IPO,目标估值约 2 万亿美元,预计年化营收超 1000 亿美元;Meta 助手 Muse 登顶美国 App Store 并开放开发者连接器;Hacktron 披露 7 月攻破 OpenAI 的完整攻击链,涉及 libheif 与 SSO 漏洞。
1️⃣ Anthropic 推进 2 万亿美元 IPO,拟在上市前发布新一代模型#
- 资本进程:Anthropic 正推进 IPO,目标估值约 2 万亿美元,有望超越 SpaceX 成为史上最大 IPO。公司预计 2026 年产生超 1000 亿美元年化营收,较 7 月的 650 亿美元大幅增长;最快 11 月挂牌,正与摩根士丹利、高盛等投行合作,接近敲定 150 亿美元循环信贷额度。
- 新模型信号:路透社报道 Anthropic 考虑在 IPO 前发布新一代旗舰模型以提振市场信心;社区传闻新款 Sonnet、Opus 与 Fable 均在灰度测试中。CEO Dario Amodei 近期一面呼吁放缓前沿模型开发,一面推进 IPO,这一姿态已引发争议。
- 算力预期:投资者预计公司年底计算能力达 5 吉瓦,明年翻倍,与 OpenAI 持平。 🔗 创业邦 AIGC 日报 | Gary Marcus 转发新模型传闻
2️⃣ Meta Muse 登顶美国 App Store,Zuckerberg 开放开发者连接器#
- 产品表现:Meta 个人 AI 代理应用 Muse 上线仅一周,登上苹果美国 App Store 免费应用榜首,超越 ChatGPT。Muse 可代表用户执行填表、购物、订餐、找宠物看护等实际任务,并连接邮箱、日历、Spotify、Instagram、OpenTable 等服务。
- 平台开放:Zuckerberg 宣布向开发者开放 Muse 连接器——开发者只需提供 API,Muse 负责 Agent、浏览器和理解用户真实需求所需的上下文;用户说出想要的服务,Agent 即自动完成后续操作。
- 商业预期:Oppenheimer 预计 Muse 到 2027 年实现 280 亿美元 AI 智能体收入,付费用户 1.15 亿,转化率与 ChatGPT 相同为 6%;但 80% 的运营利润率预测被评论质疑偏高。 🔗 Zuckerberg 公告 | Muse Connectors 平台 | Oppenheimer 预测
3️⃣ FT:OpenAI 未来五年累计负自由现金流 2780 亿美元#
- 关键数字:FT 获得的演示文稿显示,OpenAI 预计 2026 至 2030 年累计产生 2780 亿美元负自由现金流,计划在算力和基础设施上投入约 8560 亿美元。
- 含义:支出远超收入,公司需持续依赖融资;该预测与 Anthropic 同期预计超千亿美元年化营收形成对照,两家头部公司的资本策略明显分化。
- 背景:投资者正争论 AI 基础设施的巨额投入能否转化为广泛的生产力提升——马斯克当日预测 AI 将使明年美国 GDP 增速从约 2% 翻番至 4%。 🔗 创业邦 AIGC 日报
4️⃣ [持续跟踪] Hacktron 披露攻破 OpenAI 完整攻击链,libheif 漏洞波及多家公司#
- 前情提要:此前报道 Hacktron AI 团队在 72 小时内接管部分 OpenAI 员工的 ChatGPT 与 Codex 账户,并向内部代码库提交 PR 证明攻击成功;OpenAI 支付 6500 美元赏金。
- 完整攻击链:上传恶意 HEIC/HEIF 图片 → ImageMagick 解码 → 触发 libheif 堆溢出 → 在 OpenAI 论坛实现 RCE → 利用 OpenAI SSO 漏洞 → 接管 ChatGPT/Codex 账户 → 访问关联的 Outlook、Slack、GitHub。
- 影响范围:同一 libheif 漏洞还影响 Slack、Meta、GitHub Enterprise、Rails、Next.js、ImageMagick 等大量应用。OpenAI 约 14 小时修复 SSO 问题,Discourse 在周一完成修复。
- AI 的角色:Opus 4.8 发现漏洞并构建部分利用代码;Opus 5 发布几小时后即将利用代码适配 Discourse。研究者认为 AI 正降低漏洞利用门槛,原本数月的工作可能缩短至几天。 🔗 完整披露 | 技术细节
5️⃣ [持续跟踪] Jev 生态:校验器、即时压缩与广告支持的免费 AI 应用#
- 前情提要:TypeSafe AI 的决策模型 Jev 以类型化决策替代自由文本生成,发布后已出现多个开源复刻,Browser Use 用它把查航班耗时压到 7 秒、成本 0.0039 美元。
- 新应用场景:LangChain 在准确率、可重复性、延迟与成本上对比 Jev 与 LLM 裁判;开发者构建 Agent /goal 校验器,每轮检查目标是否完成;上下文压缩场景中为每次工具调用评分并直接删除无关信息;实时 3D 场景生成器通过并发数百次判断,一秒完成室内场景搭建;单次运行 50 局《地铁跑酷》成本不足 1 美分。
- 经济学判断:andrew chen 指出 Jev 比通用 LLM 便宜超 400 倍,将解锁广告支持的免费 AI 原生应用——订阅之外的新分发模式。System One 负责高速执行、System Two 负责理解推理的分层架构,正成为 Agent harness 的新设计模式。 🔗 LangChain 评测 | Jev 校验器 | 广告经济学推演 | 实时 3D 生成
6️⃣ Anthropic、OpenAI、SpaceXAI、谷歌因「呼吁放缓 AI 研发」遭反垄断诉讼#
- 诉讼核心:四家公司被指控存在串通行为——Anthropic CEO Dario Amodei 本月公开呼吁「全行业协同」以管控前沿 AI 发展节奏,马斯克、Sam Altman、Demis Hassabis 均表示认同。原告认为这构成竞争者之间非法的商业协议,诉状已提交至加州北区联邦法院。
- 原告立场:律师 Nick Rowley 称,诉讼旨在防止全球最具实力的营利性科技企业达成「利己的私下协议」,法律规则应由政府以透明合法的方式制定。
- 行业背景:Anthropic 一面呼吁「控速」一面推进 IPO,Databricks CEO 与 a16z 合伙人则批评「pacing」一词是公关失误——安全是工程问题,不是速度问题。 🔗 创业邦 AIGC 日报 | a16z 讨论
7️⃣ 阶跃星辰发布 Step 5 Preview:600B 总参、27B 激活、1M 上下文#
- 模型规格:新一代开源旗舰基础模型采用稀疏 MoE 架构,总参 600B、激活 27B,原生支持文本与视觉输入,上下文长度 1M。面向 AI 编程、软件工程、专业知识工作与金融场景。
- 评测表现:在 Artificial Analysis Intelligence Index 中得分 44,位居全球开源模型前三,进入模型智能水平与单任务成本的「帕累托前沿」;金融基准表现接近 Claude Opus 5。
- 实测与布局:Three.js 游戏、尼亚加拉瀑布 3D 还原、网页操作系统、3D 资产生成等任务完成度较高。端侧模型 Step Edge、语音模型 StepAudio 3 已发布;手机装机量超 4200 万台,覆盖国内超 50% 头部手机品牌,与吉利合作整车智能体超级 Eva。 🔗 爱范儿实测
8️⃣ LlamaIndex 发布 ParseBench:100 种文档解析方法横评#
- 基准设计:面向 AI Agent 的文档解析评测,100 种方法参与(67 个 VLM、33 个专用解析器),基于 2000 页真实企业文档与 169011 条确定性规则,完全不用 LLM 当裁判,可复现。
- 评测维度:表格结构、图表抽取、内容忠实度、格式语义、视觉定位,取无加权平均。
- 核心结论:LlamaParse 系垄断头部(Agentic Plus 90.2 领跑),第三方 Pulse 81.6、anyformat 80.3;Charts 是最大分水岭,20 多个方法归零;Grounding 是 VLM 集体盲区,部分专用解析器反而有 75–80;无一家全能——VLM 内容强、定位崩,专用解析器布局强、图表常放弃。
- 性价比:LlamaParse Cost Effective 以 0.38¢/页拿 80.6 分,为全场最佳。 🔗 ParseBench 官网 | 评测总结
9️⃣ FT:主流 AI 模型回答金融问题平均 57% 出错#
- 研究结果:FT 援引科技公司 Saturn 的研究,ChatGPT、Claude、Copilot、Grok 与 Gemini 在金融查询中平均 57% 的时间给出错误答案。
- 行业意义:金融是 AI 落地的高价值场景,也是容错率极低的场景;该数据说明在缺乏可靠验证层的情况下,模型输出尚不足以直接进入生产决策。Gary Marcus 借此再次质疑当前 AI 的可靠性叙事。 🔗 FT 报道 | Gary Marcus 转发
🔟 Android 17 首次新增 API 却不发布到 AOSP,GrapheneOS 批评 Google 收回控制权#
- 核心事实:Android 17 QPR1 是自 Android Honeycomb(3.x)以来首个为开发者添加新 API 但仅限 Pixel 设备使用的版本,其他 Android OEM 无法获得。
- GrapheneOS 批评:Google 将标准 Android 平台的安全补丁对 OEM 保密,导致其他厂商要等到 12 月 QPR2 才能获得,Pixel 则有数月独占优势;Google 未及时响应 GPL 源代码请求。GrapheneOS 已提前完成代码移植,但因权限问题无法发布。
- 社区反应:Hacker News 讨论普遍认为 Google 在市场份额达成后已无意维持开放,应尽早硬分叉或转向替代品;公司行为由商业战略而非原则驱动,不必期待其自觉。 🔗 GrapheneOS 声明 | Hacker News 讨论