OpenAI 自研推理芯片 Jalapeño 首测:效率与延迟双双超越英伟达 Blackwell

OpenAI 公布了首款自研推理芯片 Jalapeño 的首批基准测试结果。在 SemiAnalysis 公开的 InferenceX 测试中,这块标称功耗 700W、实测持续功耗不超过 550W 的芯片,在每瓦峰值吞吐量上比英伟达 Blackwell 系统高出 1.5 到 1.9 倍,端到端延迟降低 1.7 到 3.6 倍;在高交互任务中,优势扩大到 2.1 到 4.1 倍。

此前我们已从行业格局与 CUDA 护城河之争的视角拆过这颗芯片的首测成绩(OpenAI 首颗芯片 Jalapeño 实测:推理碾压 GB300,CUDA 护城河告急);本篇换一个视角,聚焦数字背后的架构取舍与全栈整合。这不只是一次产品发布。它意味着一家头部 AI 实验室在一代之内就做出了站上推理效率帕累托前沿的自有芯片。鉴于推理成本已成为大模型商业化的核心变量,控制最便宜推理栈的一方,将在下一波 AI 产品竞争中掌握定价权。

数字背后的实际含义

OpenAI 用 8K 输入、1K 输出的标准设置测试了 Jalapeño,未启用推测解码,并按各加速器的标称 TDP 归一化。测试对象包括 OpenAI 自有的 GPT‑OSS 120B、DeepSeek R1 670B 和 Moonshot 的 Kimi K2.5 1T。

在规模最大的 Kimi K2.5 上,Jalapeño 的每瓦峰值性能约为对比系统的 1.5 倍,端到端延迟降低约 3.4 倍,token 间隔时间降低约 3.8 倍。若以对比系统此前的最佳单用户速度为 latency 目标,Jalapeño 的每千瓦吞吐量可达对方的约 56 倍。在 DeepSeek R1 上,Jalapeño 单用户生成速度约 700 tok/s,对比系统约 169 tok/s。

架构差异:为什么一颗芯片能同时打赢两场仗

大模型推理分为两个阶段:处理 prompt 的 prefill 阶段算力受限,逐字生成 token 的 decode 阶段则受显存带宽限制。多数硬件只擅长其一,Jalapeño 试图同时做好两者,方法是减少数据搬运。

芯片将 KV cache 等模型状态显式留在本地,网络被当作架构的一部分而非外接总线,因此整个负载可在一个连接域内完成。它采用台积电 N3P 工艺,单 die 提供 13.4 PFLOPS 的 MXFP4 算力,并针对 prefill 与 decode 的动态比例做了平衡,这对 Agent 类多步任务尤为关键。

更大的图景:从买 GPU 到全栈垂直整合

OpenAI 还透露,AI 直接参与了芯片设计:从最初设计到流片仅约 9 个月,模型被用于探索实现方案、缩短验证闭环、优化算术电路。Jalapeño 由 OpenAI 与 Broadcom 联合设计,目标既是人类工程师可预测的编程目标,也是 AI 代码生成器的优化对象。

这与苹果为 iPhone 自研 A 系列芯片的逻辑相似:当硬件、软件与真实工作负载由同一家公司掌控时,优化空间不再受通用芯片边界限制。对行业而言,这也意味着推理成本压力正在推动顶尖实验室从采购 GPU 转向自研芯片--全行业围绕股权、长约与定制芯片的算力卡位,可参见我们的芯片土地争夺分析。

先别急着下结论:首测的边界

测试结果亮眼,但比较范围仍有限。InferenceX 使用固定序列长度,测试模型和对比基线由 OpenAI 选择;Jalapeño 尚未跑过多轮交互的 AgentX 工作负载。等到 2026 年底小批量部署、2027 年更大规模商用时,英伟达 Vera Rubin 也可能改写对比格局。

第一代定制芯片的供应链与产能风险同样存在。Meta 与微软的 AI ASIC 项目多年难产,说明从流片到规模化可用之间还有很长距离。一次基准测试不足以宣判 Nvidia 帝国终结。

对 AI 团队的行动建议

对开发者与基础设施团队,Jalapeño 释放的信号是把推理当作成本与延迟的联合优化问题,而不是单纯的 GPU 采购问题。三点建议:

关注每瓦有效 token 成本,而非单卡算力。 FLOPS 已不再是可靠代理,真正重要的是在用户体验可接受的延迟下,系统每瓦、每美元能交付多少有用输出--可直接套用Token 成本五层蛋糕框架重算账单结构。

模型与芯片的协同设计将成为常态。 模型研究与基础设施工程的边界正在模糊,能同时迭代两端的团队会获得结构性优势。

现在还不到抛弃 Nvidia 的时候。 Jalapeño 的大规模商用至少要到 2027 年,在那之前,云服务商和 AI 团队仍应围绕现有硬件优化,同时跟踪各家的自研芯片路线图。

常见问题

Jalapeño 是什么?
Jalapeño 是 OpenAI 首款自研 AI 推理芯片,与 Broadcom 联合设计,目标是用更低功耗、更低延迟服务大语言模型推理。

它比英伟达 Blackwell 快多少?
在公开 InferenceX 测试中,Jalapeño 在每瓦峰值吞吐量上领先 1.5–1.9 倍,端到端延迟降低 1.7–3.6 倍,覆盖 GPT‑OSS 120B、DeepSeek R1 和 Kimi K2.5。

什么时候能大规模使用?
OpenAI 预计 2026 年底先在内部小批量部署,2027 年再扩大 rollout。

发表评论

滚动至顶部