Yeekal Logo Yeekal
2,631 字
早报 | MORNING 2026-09-18

OpenAI 发布 Astra for Law,Anthropic 开放生命科学验证计划

今日要点
  • OpenAI 发布 Astra for Law,GPT-6 Astra 驱动
  • Anthropic 开放生命科学验证计划,Mythos 首次开放
  • Claude Code 上线 Projects,云端并行多线程
OpenAI 发布 Astra for Law,由 GPT-6 Astra 驱动,初期通过 Trusted Access 在 ChatGPT 和 Codex 面向精选律所开放,同步上线 26 个合作方插件与 47 个社区插件;Anthropic 开放 Life Sciences Verification Program,Mythos 首次向生命科学专业人士开放,并与 Adaptyv Bio 提供最高 100 万美元 Claude credits 验证超 5000 个蛋白质设计;Claude Code 上线 Projects beta,可将目标拆分为多个云端线程并行执行。

1️⃣ OpenAI 发布 Astra for Law:GPT-6 Astra 进入法律工作流#

  • 核心发布:OpenAI 推出 Astra for Law,由 GPT-6 Astra 驱动,提供法律工具、设置和上下文,初期通过 Trusted Access 在 ChatGPT 和 Codex 面向精选律所开放,API 稍后。
  • 生态插件:同步上线 26 个合作方插件与 47 个社区插件,合作方包括 Thomson Reuters、Harvey、Legora、iManage。
  • 行业意义:法律工作从通用聊天转向带领域插件、权限配置和可审计工作流的垂直产品,可能推动律所采购与合规评估。 🔗 OpenAI 官方 | 插件公告 | Trusted Access

2️⃣ Anthropic 开放生命科学验证计划,Mythos 首次向生物学者开放#

  • 核心发布:Anthropic 开放 Life Sciences Verification Program 申请,通过新的安全措施让生命科学专业人士使用其模型,包括 Mythos。
  • 蛋白设计竞赛:与 Adaptyv Bio 合作,提供最高 100 万美元 Claude credits,实验验证超过 5000 个蛋白质设计;Modal 提供最高 25 万美元算力,Twist Bioscience 提供 DNA。
  • 模型优化:Claude 为 30 多个开源生物分子模型优化推理,平均提速 4 倍,部分通过编写 GPU 自定义软件实现,优化代码已开源。 🔗 LSVP 公告 | 蛋白质竞赛 | 生物模型优化 | 代码

3️⃣ Claude Code 上线 Projects:一个对话调度并行云端线程#

  • 核心功能:Claude Code 在桌面与网页端上线 Projects beta,用户描述目标后,Claude 将工作拆分为多个线程,在云端并行会话中执行,并在关闭电脑后继续运行。
  • 协作机制:线程之间可传递上下文,共享项目记忆;每个线程是独立的 Claude Code 会话,拥有自己的分支和仓库副本,遇到同一代码段按合并冲突处理。
  • 可用范围:首批向部分 Pro 和 Max 用户的云会话开放,旧项目保持可用,本地文件与内网支持待后续。 🔗 Claude 官方 | 公告 | ClaudeDevs

4️⃣ Google 更新 Gemini 托管 Agent:成本最多降 30%,新增 Files/Credentials API#

  • 性能与成本:新版 Gemini managed agents 缓存命中最高提升 22%,成本最多降低 30%,并在 Google AI Studio 与 Gemini API 提供免费层。
  • Files API:支持在 Agent 沙箱中上传、列出、下载文件,沙箱可通过 environment_id 跨轮次持久化。
  • Credentials API:可注册 bearer token、环境变量或 OAuth2,Agent 只看到占位符,真实密钥由出口代理在 allowlist 域名替换,避免明文进入模型上下文。 🔗 Files API 文档 | Credentials API 文档 | 更新说明

5️⃣ World Labs 发布 Atlas:32 张图生成可实时漫游 3D 世界#

  • 模型能力:Atlas 将文本、图像、视频与 3D 放进共享空间上下文,可用 32 张输入图像生成 NVIDIA Voyager 总部的实时可探索场景,并支持像素级相机控制。
  • 训练与展示:模型从头在 NVIDIA Blackwell GPU 上预训练;World Labs 同时演示从单张照片生成可导航 3D 世界,以及用手机视频生成机器人训练仿真空间。
  • 行业意义:世界模型从离线渲染走向实时空间交互,潜在应用覆盖机器人仿真、游戏、影视预演与空间内容生成。 🔗 World Labs | NVIDIA AI | The Rundown

6️⃣ fal 重构 MiniMax H3:开源视频模型提速 35 倍,支持连续 60 分钟生成#

  • 性能提升:fal 团队重写 MiniMax H3 的推理流程,减少生成步骤并优化各阶段代码,将 GPU 利用率从 30–40% 提升到 70–80%,速度提升 35 倍且不损失质量。
  • 实时交互:H3 Max 实现 5 秒视频约 1.5 秒生成,可流式无限生成并支持最长 60 分钟连续、动作可控的视频,用户可中途插入提示并保持场景一致性。
  • 商业信号:好莱坞从一年前几乎不用 AI 变成 fal 增长最快客户 segment,Amazon MGM 的 Project Nara 背后使用其基础设施;专业工作流出现 Blender 低模渲染 + Astra 生成 Blender 场景 + H3 Max 出片。 🔗 a16z 对话 1 | 实时生成 | 好莱坞

7️⃣ Jina AI 发布 jina-ocr-v1:面向低预算 GPU 的多语言文档解析#

  • 模型规格:总参数 3.4B,激活参数 570M,内置投机解码;基于 DeepSeek-OCR 后训练,强化 25 种语言支持,并针对 NVIDIA L4 等低预算 GPU 优化。
  • 评测表现:在 OmniDocBench v1.6 得分 91.14,olmOCR-Bench 得分 83.4,官方称页面吞吐在所有竞品中最高。
  • 可用性:已在 Hugging Face 与 Jina Reader x-respond-with 上线,支持 PDF、扫描件、表格、图表与发票转干净 Markdown。 🔗 Hugging Face | 技术报告 | 模型页 | 公告

8️⃣ Notion 发布 Skills API,Vercel CLI 支持从 Notion 安装 Agent 技能#

  • 核心发布:Notion 推出 Skills API,团队可在 Notion 页面中编写、评审、更新 Agent 技能,并同步到 GitHub,供 ChatGPT、Claude 等 Agent 使用。
  • CLI 集成:Vercel skills CLI 1.7.0 新增 Notion skills 数据库作为安装源,运行 npx skills add <notion url> 或 npx skills add notion 即可浏览和安装。
  • 权限模型:技能访问跟随 Notion 页面权限,控制谁可安装等同于控制谁可查看页面;格式为 Agent Skills 标准文件夹,可被任何读取该格式的 Agent 使用。 🔗 Notion Skills API | Vercel changelog | Notion 公告

9️⃣ NVIDIA 论文 Agora:用 Git 作共享记忆,13 个 Agent 协作 12 天#

  • 机制设计:Agora 将每个结果、假设和验证记录为不可变 Git commit,父边表示依赖关系,索引列出开放分支与已验证声明,避免多个研究 Agent 重复实验。
  • 实验规模:13 个 LLM worker 近 12 天无中央规划器运行,目标是初始化一个 119.6M 参数混合模型且无训练数据与梯度更新;worker 共提交 1703 项贡献。
  • 结果:评估器从 3.39 降至 1.899 bits per byte,缩小 62% 与训练过的 GPT-2 124M 的差距;165 次独立复现全部成功。 🔗 论文 | 解读 | AK 转发

🔟 Google DeepMind 开放 AlphaGenome Atlas,绘制 2500+ 基因调控模式#

  • 核心发布:DeepMind 与 Stowers 研究所合作,用 AlphaGenome Atlas 绘制 2500 多个调控模式,识别充当生物开关和音量旋钮的 DNA 序列。
  • 开放与使用:数据库免费开放,供研究者解析疾病遗传成因;Broad Institute、Exeter 大学等已用其识别潜在致病 DNA 变异并解释其作用。
  • 行业意义:基因组调控数据从专有研究资产转为公开基础设施,有望加速疾病变异解释与药物靶点发现。 🔗 Atlas 数据库 | DeepMind 公告 | 开放说明

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
Tencent/BrowserSkillAI Agent / 浏览器自动化4.1k
Tencent/WeKnoraRAG / 知识平台26.2k
addyosmani/agent-skillsAI Agent / 编码代理技能95.8k

1. Tencent/BrowserSkill ⭐ 今日 +1302#

语言/许可: TypeScript / MIT
总 Stars: 4.1k
仓库: GitHub

项目定位:
面向 AI Agent 开发者,解决 Agent 无法安全复用真实登录态浏览器的问题,让 Agent 在独立窗口操作已登录站点而不打断用户。

核心功能:

  • 通过 bsk CLI + 浏览器扩展连接 Cursor、Claude Code、Codex 等 shell-capable Agent,无模型/框架锁定。
  • Agent 可显式借用已打开标签页,任务结束后归还,不影响其他浏览器会话。
  • 提供独立可见的 Agent Window 执行浏览器任务,支持人工接管验证码、登录、确认弹窗。
  • 支持全页截图、会话管理、bsk doctor 诊断,以及 Chrome/Edge 等 Chromium 浏览器。

技术亮点:
CLI/daemon 与浏览器扩展分离,利用真实登录态而非测试账号;任务在独立窗口执行,避免污染用户浏览器上下文。


2. Tencent/WeKnora ⭐ 今日 +1125#

语言/许可: Go / NOASSERTION(README 标注 MIT)
总 Stars: 26.2k
仓库: GitHub

项目定位:
面向企业知识库与 RAG 场景,解决文档分散、检索与多步推理难以统一的问题,将原始文档转化为可查询的 RAG、自主推理 Agent 和自维护 Wiki。

核心功能:

  • 文档解析与多源同步:支持 PDF、Word、Excel、图片、XMind 等 10+ 格式,以及飞书、GitLab、Notion、语雀等数据源。
  • RAG + ReAct Agent:提供快速问答、自主检索、MCP 工具调用、Web 搜索和多步任务编排。
  • Wiki 模式与知识管理:Agent 将原始文档蒸馏为互链 Markdown 知识库,支持知识图谱、修订历史和回滚。
  • 企业级多租户:多工作区 RBAC、scoped API keys、审计日志、沙箱运行时(Docker/E2B/Cube)和 Langfuse 可观测性。

技术亮点:
模块化可替换架构,支持 20+ LLM 提供商、向量库与存储后端;内置 MCP Server 与 Langfuse 观测,支持多租户 RBAC 和沙箱隔离。


3. addyosmani/agent-skills ⭐ 今日 +680#

语言/许可: JavaScript / MIT
总 Stars: 95.8k
仓库: GitHub

项目定位:
面向 AI 编码代理用户,解决代理在不同开发阶段行为不一致、缺少质量门禁的问题,将工程流程编码为可复用技能和 slash 命令。

核心功能:

  • 25 个技能覆盖开发生命周期,9 个 slash 命令(/spec、/plan、/build、/test、/review、/ship 等)。
  • 通过 npx skills add 安装到 Claude Code、Cursor、Codex、Copilot、Cline 等 70+ Agent。
  • 支持按上下文自动激活技能,例如设计 API 触发 api-and-interface-design,构建 UI 触发 frontend-ui-engineering。
  • /build auto 可基于已批准计划自主执行所有任务,但仍保持测试驱动、逐任务提交和失败暂停。

技术亮点:
技能以纯 Markdown 定义,兼容任何接受系统提示或指令文件的 Agent;通过 skills CLI 和插件机制实现跨 Agent 分发。

2,086 字
晚报 | EVENING 2026-09-18

DeepMind 发布 Dream-RSI,Anthropic 披露 Claude 主导 26% 研发

今日要点
  • DeepMind 发布 Dream-RSI,Agent 调用最多减少 162 倍
  • Anthropic:Claude 主导 26% 研发,3 万 Agent 并发
  • Hacktron 用 Opus 5 攻破 OpenAI,成本低于 3000 美元
Google DeepMind 发布 Dream-RSI,用回放历史尝试优化探索策略,最高减少 162 倍 Agent 调用;Anthropic 披露 Claude 已主导 26% 的内部 AI 研发,3 万 Agent 并发;Hacktron 用 Claude Opus 5 攻破 OpenAI 员工账号并进入其内部代码仓库。

1️⃣ DeepMind 发布 Dream-RSI:用回放优化探索策略,Agent 调用最高减少 162 倍#

  • 核心方法:Dream-RSI 让 AI Agent 回放过去的发现尝试,低成本测试数千种替代探索策略,再把更优策略部署到下一轮。它改进的是探索策略,而非底层模型权重。
  • 实验表现:在算法设计、数学优化和 GPU 内核工程任务中,Dream-RSI 保持或提升了发现质量,同时大幅降低搜索成本,一种场景下将 Agent 调用次数最多减少 162 倍。
  • 行业意义:该工作把递归自我改进拆解为可优化的探索策略问题,为长周期 AI 发现任务提供了一种新的工程路径,但目前仍属研究演示,尚未产品化。 🔗 论文 | 社区转述

2️⃣ Anthropic 首次公开内部研发指标:Claude 主导 26% 的 AI 研发工作#

  • 研发自动化:Anthropic 披露,Claude 已能“主导”26% 的内部 AI 研发工作,超过 90% 的研发工作达到 AI 深度协作或更高等级,但尚无完全自主的闭环项目。
  • 智能体规模:其最常用内部平台上,任一时点约有 3 万个智能体从事研究和工程工作。2026 年 8 月超过 10 亿次决策中,约 0.002% 被在线监控拦截。
  • 算力分配:算力样本取自 7 月 13 日至 20 日,AI 研发算力中约 6% 用于安全工作;若只看 AI 驱动研发部分,安全占比约 12%。Anthropic 计划引入独立第三方核验这些指标。 🔗 Anthropic 官方 | 指标解读

3️⃣ 安全事件:Hacktron 用 Claude Opus 5 攻破 OpenAI 员工账号并进入内部代码仓库#

  • 攻击链条:安全公司 Hacktron 三名研究员在 7 月 25 日串联两个漏洞。入口是 OpenAI 官方社区论坛 Discourse 的 libheif 堆溢出漏洞,上传特制 HEIC 图片即可在论坛服务器执行任意代码;随后利用 OpenAI SSO 配置缺陷接管活跃论坛用户的 ChatGPT 和 Codex 账号。
  • 证明方式:为在不接触敏感信息的前提下证明权限,研究人员让一名员工的 Codex 在 OpenAI 内部主代码仓库 openai/openai 中开了一个无害 PR,随后停手。漏洞已修复,OpenAI 在收到报告约 14 小时后确认修复,并支付 6500 美元赏金。
  • 成本与模型差异:整次入侵的 token 花费不到 3000 美元。研究人员先用 Opus 4.8 写利用代码但受 ASLR 阻碍,Anthropic 发布 Opus 5 后,新会话在 3 小时内跑通本地利用,并在第二天早上确认可攻击论坛实例。 🔗 WSJ 报道 | 技术复盘

4️⃣ Figure 发布 Helix 2.5:零样本进入 30 个陌生家庭做家务,成功率 56%#

  • 实测设置:Figure 在旧金山湾区租下 30 栋团队和机器人从未进入过的房子,事先不采集任何数据,让机器人直接完成收拾客厅、叠毛巾、铺床三项全身长程任务。
  • 关键数据:三项任务综合单次试验成功率达到 56%,基线为 9%,30 个家庭每一个都有成功完成记录。模型具备全身自我纠错能力,失误后可退后调整站姿、换角度或绕行纠正。
  • 训练基础:Helix 2.5 基于 Figure 自建的 Index 数据集预训练,该平台每周有超过 9 万人贡献数据,每秒上传 35 分钟人类行为。Figure 还报告了首个在人形机器人上测量到的人类到机器人迁移 scaling law,预测误差仅 0.54%。 🔗 Figure 演示 | 详细解读

5️⃣ 阿里发布 Qwen3.8-Omni-Flash:首个面向 Agent 的全模态模型,视频输入成本降约 89%#

  • 核心能力:Qwen3.8-Omni-Flash 原生支持音视频理解、推理和工具使用,可理解内容、规划任务、调用工具并交付结果,支持 1M token 上下文和 Agentic 感知。
  • 性能与成本:官方称其音视频能力逼近 Gemini 3.8 Flash,在 WildClawBench-MM 与 UniClawBench 上 Agent 性能平均提升 19.5 分;视频输入成本较 Qwen3.5-Omni-Plus 降低约 89%。
  • 生态开放:阿里同步开源 Qwen-MM-Plugins 和 Qwen-Live Harness,降低开发者围绕全模态 Agent 构建应用的门槛。 🔗 Qwen 官方博客 | 官方推文 | GitHub

6️⃣ 腾讯微信视觉团队开源 WeVisDoc:端到端文档解析器,OmniDocBench 得分 95.38#

  • 模型规格:WeVisDoc 基于 Qwen3-VL-2B/4B-Instruct 微调,提供 2B 和 4B 两个版本,支持中英文,许可证为 Apache-2.0。输入页面图像可直接输出结构化 Markdown,文本、LaTeX 公式、HTML 表格和阅读顺序统一在单序列中。
  • 基准表现:在 OmniDocBench v1.6 上,WeVisDoc-4B 取得 95.38 分,超过此前最强的 HunyuanOCR-1.5 的 94.74 分。在 PureDocBench 的干净、数字退化、真实拍摄三个子集上均领先约 1.4 分。
  • 训练策略:采用“From Coverage to Capability”的两阶段训练,先扩展覆盖,再通过残差分析把训练预算定向投放到薄弱区域。内部消融显示,能力分配带来的增益随场景退化程度递增,真实拍摄场景增益达 +4.03。 🔗 项目主页 | Hugging Face | 技术解读

7️⃣ 华为昇腾 960 提前至明年一季度,超节点扩至 4096 卡#

  • 路线图更新:华为在全联接大会上公布,昇腾 960DT 将于 2027 年第一季度推出,比原计划提前三个季度;960PR 和 Atlas 960 液冷节点计划在第三季度推出,昇腾 970、980 分别安排在 2028 年和 2029 年。
  • 超节点规格:采用 NPO 技术的昇腾 960 超节点单节点支持 4096 张卡,通过灵衢架构与 Hi-ONE 光引擎连接,往返通信时延 2 微秒,可支持 10 万亿参数模型的训练和推理。
  • 集群扩展:华为同时公布鲲鹏超节点最大支持 4096 个节点、256TB 统一内存池,以及 OceanStor M900 AI 记忆存储,为智能体和长序列推理提供 PB 级 KV 缓存。通过灵衢 UnifiedBus 互联,集群可扩至 51.2 万卡,多轨道拓扑下最大支持 100 万卡。 🔗 爱范儿报道

8️⃣ Manus 商谈 5 亿美元融资,目标估值约 40 亿美元#

  • 融资进展:据彭博社报道,Manus 正与投资者商谈新一轮融资,计划募集 5 亿美元,目标估值约 40 亿美元,为此前估值的两倍。
  • 背景信息:这将是 Manus 与 Meta 拆分后首次寻求融资。报道称融资计划近期完成,但讨论仍在进行,具体条款可能变化。腾讯、红杉中国和真格基金是其现有投资者。 🔗 量子位报道

9️⃣ [持续跟踪] Jev 生态落地:Browser Use 实测查机票 7 秒,单次成本 0.0039 美元#

  • 前情提要:TypeSafe AI 发布 Jev,一个不逐 token 生成文本、只返回结构化决策与概率的 System One 模型,已上线 OpenRouter。
  • 最新突破:Browser Use 创始人 Gregor Zunic 实测接入 Jev 后,查询真实航班机票从打开网页、输入筛选到返回结果全程仅 7 秒,单次成本 0.0039 美元。其动态动作空间让 Jev 直接面对 DOM 状态输出点击、滚动、输入等决策,仅在需要文字输入时临时调用小模型。
  • 生态反应:LangChain 已用 Jev 增强 harness;开发者用 Jev 做 YouTube 赞助片段实时检测,单视频成本约 0.005 美元。
  • 行业意义:Jev 正被用作路由、判断与结构化决策层,把高频低延迟的“下一步做什么”从大模型推理中拆出,可能成为 Agent 运行时的一个新基础组件。 🔗 Browser Use 开源实现 | LangChain 集成 | YouTube 检测项目