Yeekal Logo Yeekal
2,924 字
早报 | MORNING 2026-08-26

OpenAI 公布自研推理芯片 Jalapeño 首轮实测,Perplexity 发布 Portable Computer

今日要点
  • OpenAI 公开自研推理芯片 Jalapeño 首轮实测,每瓦性能 1.9 倍于 NVIDIA
  • Perplexity 发布 Portable Computer,完整 Agent 栈本地运行,知识工作 82.6 分
  • OpenAI 推出 WebMCP 开放标准,设 $35,000 挑战赛,9 月 3 日截止
OpenAI 公开自研推理芯片 Jalapeño 首轮实测,从设计到流片用时 9 个月,每瓦吞吐达 NVIDIA GB200/GB300 的 1.9 倍,响应速度最高快 3.6 倍,年底部署;Perplexity 发布 Portable Computer,Agent 栈全部本地运行,知识工作得分 82.6%;Google Cloud 推出 Gemini Enterprise 法律与金融行业套件。

1.OpenAI 公布自研推理芯片 Jalapeño 首轮实测数据#

  • 核心亮点:OpenAI 首次公开自研推理芯片 Jalapeño 的实测性能,称其每瓦吞吐与 token 延迟优于对比中的商用系统,并计划年底部署。
  • OpenAI 在 InferenceX 公开基准(GPT-OSS 120B)上测得更高峰值吞吐/千瓦与更低 token 延迟,在 DeepSeek R1 与 Kimi K2 上同样表现强劲。
  • 据媒体转述,Jalapeño 每单位电力完成的工作量最高达 NVIDIA GB200/GB300 的 1.9 倍,响应速度最高快 3.6 倍。
  • 芯片设计过程中 AI 直接参与探索实现、缩短设计测量验证循环,并优化算术电路,从初始设计到 tapeout 用时 9 个月。
  • OpenAI 表示年底前在自建算力基础设施中部署 Jalapeño,Gen 2 已深度开发,Gen 3 正在成型。

🔗 OpenAI 官方博客 | Sam Altman 推文 | The Rundown 报道

2.Perplexity 发布 Portable Computer:本地运行完整 Agent 栈#

  • 核心亮点:Perplexity 推出 Portable Computer,将 orchestrator、子 Agent 与 harness 全部放在 DGX Spark 本地,无云端依赖。
  • 首发内置后训练 PPLX 27B,也支持 Qwen 3.8 27B,后续将支持 NVIDIA Nemotron 3.5 Lightning;面向 Perplexity Pro/Max 用户开放。
  • 真实知识工作得分 82.6%(对比开源 harness Pi 与 Hermes),后训练版 PPLX 27B 达 85.4%。
  • 解析完全在设备端进行:ParseBench-100 得分 65.1%,Hermes 与 Pi 分别为 34.6% 与 13.9%;BrowseComp 上准确率 66.7%,优于 Pi 的 50.2%。
  • 本地模型可经用户授权升级到前沿模型,Terminal Bench 2.1 上分数从 59.6% 升至 73.0%,单次 rollout 成本约 $0.415。

🔗 Perplexity 发布推文 | Portable Computer 博客 | Benchmark 推文

  • 核心亮点:Google Cloud 同日推出面向法律与金融的 Gemini Enterprise 行业套件,用 MCP 连接器与预置 Agent 切入生产工作流。
  • Legal 侧覆盖合同审查、监管扫描、DSAR、密封文件脱敏,连接 iManage、NetDocuments、Docusign、Everlaw、RelativityOne、Thomson Reuters HighQ 与 Harvey 等系统。
  • Financial 侧以 Financial Research Agent 为核心,内置 50+ 基础技能,输出带置信度、方法论、数据快照与引用;连接 FactSet、Moody’s、MSCI、PitchBook、SEC EDGAR 等。
  • 两者共用治理控制平面:VPC/CMEK、数据隔离与可验证 grounding;客户数据不用于训练 Google 基础模型。
  • 已与 Cleary Gottlieb、Freshfields、Weil、Williams & Connolly,以及 Deutsche Bank、CME Group 等机构共同开发。

🔗 Legal 发布博客 | Financial Services 发布博客

4.OpenAI 发布 WebMCP 开放标准,并启动 10 天挑战赛#

  • 核心亮点:OpenAI 推出实验性开放标准 WebMCP,让网页应用直接向 Agent 暴露工具,并联合多家平台举办黑客松。
  • ChatGPT 桌面端内置浏览器与 ChatGPT Sites 已支持 WebMCP;Codex 可创建 WebMCP 应用并部署到 Sites。
  • 合作伙伴包括 ChromiumDev、CloudflareDev、ShopifyDevs、Vercel、Render、Netlify;总奖金 $35,000,另有 Codex Micros 与 ChatGPT Pro 订阅。
  • 参赛作品需在 9 月 3 日前提交,10 个获奖项目将于 9 月 23 日公布。
  • 同日,ChatGPT 浏览器扩展新增 Edge、Brave、Opera、Vivaldi 支持,可将当前标签页上下文带入 Codex 任务。

🔗 WebMCP 标准介绍 | 挑战赛公告 | 浏览器扩展更新

5.ChatGPT Work 上线安全网站登录,Agent 可代办真实账户操作#

  • 核心亮点:ChatGPT Work 今天开始能在网页与移动端用自带浏览器替用户登录网站,全程不接触用户名和密码。
  • 适用于 Plus、Pro、Business 用户;OpenAI 列举预约、账单、保险报销、租赁房源筛选等 19 类实际任务。
  • Greg Brockman 称其为 ChatGPT Work 的“安全登录账户”能力。

🔗 ChatGPT 官方推文 | Greg Brockman 推文

6.微软 MAI-Image-2.6-Preview 登顶图像编辑榜#

  • 核心亮点:微软 MAI-Image-2.6 在 Artificial Analysis 图像编辑榜排名第一,文本生图榜仅次于 GPT Image 2。
  • 超越 MAI-Image-2.5-Pro、Reve 2.1 与 GPT Image 2,使微软占据榜单前二。
  • 在刷新后的文本生图分类中,于 Material、Knowledge、Frontier、Retail & Ecommerce、Marketing & Advertising 5 个类别登顶。
  • 该模型 8 月 10 日发布,支持文生图与图像编辑;现可在 MAI Playground 与 Microsoft Foundry Private Preview 体验。
  • Mustafa Suleyman 表示微软已占据榜单 Top 5 中的 3 席。

🔗 Mustafa Suleyman 推文 | Artificial Analysis 榜单

7.Vercel Connect 正式 GA:Agent 安全连接 100+ 外部服务#

  • 核心亮点:Vercel Connect 结束预览,为应用和 Agent 提供短时、受限、可审计的第三方服务连接。
  • 支持 Slack、Linear、GitHub、Notion、Salesforce 等 100+ 服务;采用短时 scoped token、token/trigger 可观测性、RBAC 与审计日志。
  • 通过 @vercel/connect/ai-sdk,AI SDK agent 可直接连接 MCP 服务器;v0 也已内置该能力。
  • Rauch 称构建 Agent 最难的问题是服务与数据的安全连接;可用 vercel connect create notion 后直接查询 MCP client。

🔗 Vercel 公告 | AI SDK 推文 | Rauch 推文

8.Shopify CEO 扬言禁用 Claude Code,要求支持 AGENTS.md#

  • 核心亮点:Shopify CEO Tobi Lütke 公开威胁,若 Anthropic 不改变 Claude Code 只读 CLAUDE.md 的行为,将在 Shopify 禁用该工具。
  • Tobi 表示:Claude Code 坚持只读 CLAUDE.md,导致团队内不同工具使用者出现“split brain”问题。
  • Hugging Face CTO Julien Chaumond 转发并希望该推文有足够能见度推动改变;多位开发者认为这是长期未解决的诉求。
  • 争论核心是 Agent 配置/技能标准的统一:.agents/skills 与 AGENTS.md 能否被主流 coding agent 共同遵守。

🔗 Tobi 推文 | Julien Chaumond 推文

9.Andrew Ng 发布 OpenWorker 新版:开源 Agent 内置网络安全扫描#

  • 核心亮点:Andrew Ng 团队发布开源 Agent OpenWorker 新版本,内置漏洞扫描、依赖投毒检测与云安全配置检查三类安全 Agent。
  • 开源 harness 可被安全团队审计,避免后门/数据外传;支持本地运行 open-weight 模型,敏感代码不出机器。
  • 也兼容 ChatGPT 订阅、Ox Alpha 等 stealth preview 模型或任意 API key。
  • 目标是把攻击者已使用的 AI 能力赋予防御方,把更多安全工作前置到部署前(shift left)。

🔗 Andrew Ng 推文 | OpenWorker | GitHub

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
DietrichGebert/ponytailAI 开发者工具111.0k
marin-community/marin训练/基础设施2.1k
TauricResearch/TradingAgentsAI Agent100.2k

1. DietrichGebert/ponytail ⭐ 今日 +982#

语言/许可: JavaScript / MIT
总 Stars: 111.0k
仓库: GitHub

项目定位:
面向 Claude Code / Codex 等编码代理的提示层插件,通过约束模型在编码前执行“最少必要代码”决策阶梯,减少 AI 生成代码中的过度设计与无效抽象。

核心功能:

  • 内置 7 级决策阶梯(YAGNI → 复用 → 标准库 → 原生平台 → 已装依赖 → 单行 → 最小实现),在改写代码前拦截过度构建。
  • 支持 Claude Code、Codex、Copilot CLI、Gemini CLI、OpenCode、Qoder、Pi 等 20+ 编码代理/编辑器。
  • 提供 lite/full/ultra 模式,以插件或 AGENTS.md 方式注入规则;包含 /ponytail-review 等审计命令。
  • 保留安全护栏:trust-boundary validation、错误处理、可访问性检查不会被“精简”削减。

技术亮点:
以 Node.js lifecycle hooks 在每轮对话注入上下文;在真实 FastAPI+React 仓库上以 Claude Code(Haiku 4.5, n=4)做 agentic benchmark,平均减少 54% 代码行、20% tokens、27% 耗时。


2. marin-community/marin ⭐ 今日 +231#

语言/许可: Python / Apache-2.0
总 Stars: 2.1k
仓库: GitHub

项目定位:
面向基础模型研究团队的开源训练平台,覆盖数据治理、tokenization、预训练、后训练与评测全流程,强调“开放开发”——所有实验、失败记录与过程知识均随代码发布。

核心功能:

  • 实验脚本用 Makefile 式依赖图定义,step 间按拓扑序执行,支持从 TinyStories 到多 TPU slice 的规模扩展。
  • 数据集管线可确定性复现,已支持 Nemotron-CC、StarCoderData、ProofPile 2 等公开语料的混合与过滤。
  • 内置 scaling suite(Delphi),基于 3e18–1e23 FLOPs 的训练运行提供可插值的 scaling law 与 checkpoints。
  • 除 LLM 外,亦已用于音频-文本、DNA、蛋白质模型训练,具备库级复用能力。

技术亮点:
与 Stanford CRFM/Open Athena 合作,基于 Levanter/Fray 生态构建;实现 MoE quantile balancing(在 32B-A5B / 1e22 FLOPs 规模验证)及异构集群调度;支持 TPU multislice 与 GPU 混合训练。


3. TauricResearch/TradingAgents ⭐ 今日 +218#

语言/许可: Python / Apache-2.0
总 Stars: 100.2k
仓库: GitHub

项目定位:
面向金融 NLP 与量化研究的 LLM 多智能体交易框架,用角色分工模拟真实交易公司流程,用于市场分析、策略辩论与决策回测(研究用途)。

核心功能:

  • 智能体团队:基本面/情绪/新闻/技术分析师 + 多空研究员辩论 + 交易员 + 风控 + 投资组合经理,形成完整决策链路。
  • 多 LLM 后端:一次配置支持 OpenAI、Anthropic、Google、xAI、DeepSeek、Qwen、GLM、MiniMax、Bedrock、Ollama 以及任意 OpenAI-compatible 服务。
  • 工程化运行:Python 包 + CLI + Docker 部署,支持 LangGraph checkpoint 恢复、持久化决策日志、Alphavantage look-ahead filtering(防未来数据泄漏)。
  • 结构化输出与可配置 retry budget,利于回测稳定性与结果复现。

技术亮点:
基于 LangGraph 做图状态编排与 crash-safe 恢复;支持 OpenAI-compatible 统一推理接口和本地 vLLM/llama.cpp 接入;具备非美国市场回测基准。

🟧 Hacker News 热议#

OpenAI Jalapeño: Better than Nvidia Blackwell#

279 pts · 193 comments · site

📌 内容总结

  • SemiAnalysis 受邀赴 OpenAI 实验室,实测其自研推理 ASIC“Jalapeño”,并公布架构细节与 InferenceX 基准。该芯片由 OpenAI 与 Broadcom 合作,从 2024 年中组建团队到流片约 16 个月,从零起步且速度极快。
  • 性能与设计:
    • 在 InferenceX 8k1k 测试中,perf/W 全面超过 Blackwell、AMD、Google 同期芯片;对比 Vera Rubin 的 MTP 结果也胜出,且 Jalapeño 未使用 MTP、投机解码(speculative decoding)或 prefill/decode 分离。
    • 明确不做 PDD 和投机解码:生产负载的 prefill/decode 比例动态变化,固定池化反而导致全局利用率下降;同构池保持负载灵活性,同时避免 KV cache 跨网络迁移。
    • 架构上采用 OoO 核心 + L1 cache,替代常见软件管理的 scratchpad,减少固定开销;支持“小矩阵”形状,规避大脉动阵列在非整齐维度上的性能悬崖;简化 NoC 与内存层次以提升能效。
    • 软件栈:Gluon(基于 Triton 的方言)暴露 PTX 级底层抽象和 Linear Layouts;Codex 参与内核编写与调优,甚至用 Codex prompt 将 Doom 移植到该芯片运行;8 天内将模型配置从 TP8 扩展到 TP32。
  • 限制与风险:
    • 所有性能数据由 OpenAI 提供,SemiAnalysis 现场确认了 InferenceX 运行,但未运行其更贴近真实生产负载的 AgentX 套件;测试仅覆盖 8k1k 单轮。
    • 与 Blackwell 对比被认为“不公平”,Jalapeño 真正对手是已开始出货的 Vera Rubin;且生产爬坡要等到 2027 年,当前只有工程样品。

💬 讨论总结

  • 本次输入数据的 top_comments 为空,未能抓取到 HN 评论内容,因此无法提炼社区讨论的具体观点、支持/反对理由或工程经验。

🔗 原文 · HN 讨论页

1,975 字
晚报 | EVENING 2026-08-26

OpenAI 芯片实测与平台化,Nvidia 60 亿美元押注开放模型

今日要点
  • OpenAI 披露 Jalapeño 实测数据,年底部署自有算力
  • Nvidia 拟 60 亿美元打造开放权重模型,投资 Poolside
  • Ox Alpha 被证实为智谱 GLM-5.3-Flash
OpenAI 公布 Jalapeño 芯片完整实测并明确平台化战略,Agent 用户达 2000 万;Nvidia 拟 60 亿美元开发开放权重模型;Ox Alpha 被证实为智谱 GLM-5.3-Flash;Qwen 预告 Flash-Next 明日发布。

1. [持续跟踪] OpenAI 自研推理芯片 Jalapeño:完整实测、成本与 AI 辅助设计细节出炉#

  • 核心亮点:OpenAI 首颗自研推理 ASIC 的实测全面超过英伟达 GB200/GB300,标称 TCO 与 H100 持平,年底部署。
  • 前情提要:此前 OpenAI 公布 Jalapeño 为自研推理芯片,首批数据已在社交媒体放出。
  • 最新进展:InferenceX 基准显示,GPT-OSS 120B 单用户出词 1459 tokens/s,是 GB200 的 2.7 倍;DeepSeek R1 670B 端到端延迟 1.65 秒,GB300 为 5.99 秒;Kimi K2.5 1T 上峰值每瓦吞吐提升约 1.5 倍。
  • 设计与成本:芯片功耗标称 700W(约为 GB300 一半),SemiAnalysis 估算每芯片每小时 TCO 约 1.56 美元,低于 Vera Rubin 的 3.61 美元;从设计到流片 9 个月,AI 参与电路设计与内核优化,部分生成模块比人类实现快 1.5-1.8 倍。
  • 部署与影响:年底部署进自有算力,目标 100MW 规模;Gen 2 深度开发中。芯片被描述为通用推理芯片,不只运行 OpenAI 自家模型,也实测了 DeepSeek R1 与 Kimi K2.5。 🔗 爱范儿详细报道 | Greg Brockman on chip design

2. OpenAI 平台化战略:Altman 称 ChatGPT 与 Codex 已合并#

  • 核心亮点:Sam Altman 在访谈中明确 OpenAI 下一阶段从产品公司转向平台公司,开发者通过 API 在统一入口之上构建产品。
  • ChatGPT 与 Codex 已合并,未来用户只需一个入口调用个人或企业 AGI。
  • OpenAI 不会进入所有产品类别与客户竞争,而是覆盖完整性价比曲线,目标服务 1 亿家新企业和全球 80 亿人。
  • 与平台化同步,OpenAI 正将订阅体系拆分为 Plus/Pro/Business 等多层,以匹配不同用量需求。 🔗 AI Will 摘录视频 | David Senra 访谈

3. OpenAI Agent 用户达 2000 万,CFO 称 2027 年上市#

  • 核心亮点:OpenAI 商业数据更新:Agent 活跃用户 2000 万,企业收入单季增长超 50%,上市时间表首次被高管公开。
  • CNBC 报道 CFO Sarah Friar 告诉员工,OpenAI“will be a public company in 2027”或更早。
  • 本季度至今年化收入增长 35%,企业业务收入增长超 50%。
  • Agent 用户对比 ChatGPT 约 10 亿活跃用户,渗透率仅 2%,被视为下一阶段增长空间。 🔗 CNBC 报道推文 | Frank Downing 数据

4. Nvidia 拟 60 亿美元打造开放权重模型,兼投 Poolside 10 亿美元#

  • 核心亮点:据 WSJ,Nvidia 将授权 Poolside 技术并纳入其 100 多名员工,组建 Nemotron 项目,投资总额达 60 亿美元规模。
  • 同时向 Poolside 追加 10 亿美元投资,投前估值 120 亿美元。
  • 目标公开:挑战 DeepSeek、Kimi 等中国开放权重模型,并直接与 OpenAI、Anthropic 竞争。
  • 行业意义:芯片巨头把开放权重模型纳入核心路线,开放模型赛道的资本与算力门槛被进一步抬高。 🔗 AI Will 中文摘录 | 原推 Chubby

5. [持续跟踪] Ox Alpha 身份确认:智谱 GLM-5.3-Flash,一周消耗 23.16T tokens#

  • 前情提要:匿名模型 Ox Alpha 在 OpenRouter 免费开放,约 100 万 token 上下文,曾冲上周榜第 2,Stripe CEO 评价“非常惊艳”;社区先猜测出自智谱,此后地理探测线索又指向美国东海岸,出现反转。
  • 最新进展:今日消息源确认 Ox Alpha 即智谱 GLM-5.3-Flash;开发者统计显示它免费开放一周在 OpenRouter 消耗约 23.16T tokens,日均超 3T,相当于每天数千万次请求。
  • 行业影响:若该模型确以较低推理成本支持免费访问,叠加此前的开源小模型表现,基础模型商品化与护城河转移的讨论会继续升温。 🔗 Geek 统计 | Di Zhang 消息源 | Ox Alpha 分析推文

6. [持续跟踪] Fable 5 高价承压:中国模型占美国企业 Token 份额超过 60%#

  • 前情提要:FT 与 Ramp 数据曾显示,Anthropic 最强模型 Fable 5 发布两月后企业支出占比约 11%。
  • 最新进展:Ramp 7 万家企业数据显示,中国模型在美国企业 Token 使用中的份额从 1 月的 4.4% 升至 60% 以上;62% 机构过去一年因意外 AI 成本改变商业决策,其中 33% 触发紧急支出冻结。
  • 竞品对比:Fireworks AI 宣称 DeepSeek V4 Pro 在 SWE-Bench 与 LiveCodeBench 上超过 Fable 5,每解决一个任务成本约为其 1/3,且不会拒绝合法的安全审查工作。
  • 影响:模型路由工具采用率目前仅 6.1%,但上升趋势明确,旗舰模型的定价权将被进一步稀释。 🔗 Sage Road/FT 数据摘录 | Fireworks 对比

7. Anthropic 发布 AI 原生 SDLC 实战手册:六阶段工件链闭环#

  • 核心亮点:官方提出“写代码不再是瓶颈”,将软件研发从线性流程改为以版本化工件自动衔接的闭环。
  • 六阶段分别对应 intent.md、spec.md、plan.md、diff/测试、带评审 PR、事故记录;每个阶段结束都提交可追溯工件,下一阶段自动触发。
  • 治理设计:CLAUDE.md 固化团队知识,Skills 做可更新的劝导性规则,Hooks 在构建期强制拦截违规,CI 中跑 20-50 个真实任务 evals。
  • 意义:人类注意力从逐行执行上移到评审闸口,治理在行动时强制执行而非事后评审,并提供受监管企业的托管配置示例。 🔗 Anthropic 原文 | KOL 解读

8. Qwen 预告 Qwen3.8-Flash-Next 明日发布:125B a6B 多模态 MoE#

  • 核心亮点:基于 Qwen4 架构的 Qwen3.8-Flash-Next 将于明日 23:00(UTC+8)发布,开源权重与 FP8 版本同步放出。
  • 规模 125B 总参数、6B 活跃参数,多模态 MoE;HN 社区关注其在 Strix Halo 等 128GB 本地设备上的运行潜力。
  • 同日,Qwen3.8-27B 登顶 Image-to-WebDev Arena 开源模型第一(总榜第七),1574 分,27B 参数比肩 2.8T 参数的 Kimi K3,价格 0.40/0.40/3 per M tokens。 🔗 ModelScope 预告页 | LMArena 公告 | Qwen 官方回应

9. 苹果推出 M6 与 M5 Ultra:Mac 本地 AI 算力换代#

  • 核心亮点:首款 2nm 制程的 M6 与四晶粒架构 M5 Ultra 发布,Mac mini 和 Mac Studio 同步更新,国行 6999 元起。
  • M5 Ultra 最高 36 核 CPU、80 核 GPU、512GB 统一内存与 1.2TB/s 带宽,官方称 AI 峰值性能较 M3 Ultra 提升 4.3 倍。
  • M6 版 Mac mini AI 性能较 M4 提升 4 倍,支持 Wi-Fi 7、蓝牙 6 与 2.5Gb 以太网;Mac Studio 支持 Thunderbolt 5,四台集群可提升分布式推理性能。
  • 意义:更大统一内存与带宽使本地运行大型模型的实用门槛降低,开发者对 Mac 作为 AI 工作站的讨论升温。 🔗 Apple Newsroom M6/M5 Ultra | Apple Newsroom Mac Studio | 爱范儿国行价格

10. 美光 HBM 架构师:“内存墙”恶化,数据搬运成为吞吐上限#

  • 核心亮点:Hot Chips 2026 上美光研究员给出量化对比:AI 加速器计算性能约两年增长 3 倍,HBM 带宽同期增长不到 2 倍。
  • 大模型推理中权重和 KV Cache 需要持续在内存与计算单元间搬运,理论算力无法等比转化为实际吞吐。
  • 解决方向:打破计算与存储边界,在芯片、封装、系统层共同优化数据路径,评估 AI 芯片需将计算、带宽、数据搬运纳入同一指标。 🔗 爱范儿报道