Jalapeno's First Results: Industry-Leading Speed and Efficiency in AI Inference
Jalapeno's First Results: Industry-Leading Speed and Efficiency in AI Inference
发表时间: 2026-08 · Blog post by OpenAI (openai.com)
原文: https://openai.com/index/jalapeno-first-results/
作者/机构:OpenAI
速读
一句话结论 OpenAI 推出了首款定制推理芯片 Jalapeño,通过软硬件全栈协同设计打破了吞吐量与延迟之间的传统权衡,在同等功耗下实现了业界领先的推理速度与能效。
要解决什么问题 现有硬件系统在处理大语言模型推理时,通常不得不在高吞吐量和低延迟之间做出妥协,其根本卡点在于推理不同阶段的瓶颈差异以及数据搬运带来的通信开销。具体而言,语言模型推理包含两个截然不同的阶段:处理提示词的 Prefill 阶段是计算密集型的,而逐个生成词元的 Decode 阶段则受限于内存带宽。当数据必须在不同的核心和芯片之间移动时,会产生显著的通信延迟,导致部分处理单元在等待数据时处于闲置状态。一个在某个特定阶段表现优异的系统,往往会在等待数据或在不同资源间转移模型状态时丧失优势。这种延迟在需要连续执行多个步骤的交互式智能体任务中尤为致命,因为每一步的等待时间会在整个任务周期内不断累加,严重拖慢端到端的响应速度。如果单纯追求吞吐量,往往需要牺牲用户的响应时间;而追求低延迟,又会导致系统能效低下,无法在给定的功耗预算内服务更多用户。
怎么做的 Jalapeño 的核心思路是围绕真实语言模型工作负载,将芯片、内存、网络、软件和机架级系统进行全栈协同设计,通过极简的数据移动和高度可预测的编程模型来绕开通信延迟卡点。该架构包含三个关键设计:首先是显式的数据局部性管理,系统能够将模型状态(包括生成响应时使用的 KV cache)显式地放置并保持在本地,同时为每个推理阶段激活最合适的计算、内存和网络资源组合,从而避免了跨组件搬运状态的开销。其次是原生集成的大域网络(large domain network),它允许整个工作负载保留在一个互连系统内,确保完整的请求从头到尾保持高效。这种设计造就了一个平衡且支持灵活调配的加速器,使系统能够在 Prefill 和 Decode 阶段之间平滑切换,并实时适应两者比例的动态变化,这正是智能体工作负载的核心特征。最后是面向 AI 优化的可预测编程结构,硬件被设计为具有局部张量、显式通信和可预测同步机制的清晰目标,这使得 AI 模型(如使用 Codex 结合 GPT-Astra)能够直接接管传统上极其困难的并行编程任务,自动优化工作负载在系统中的映射、放置、调度和协调。此外,AI 还被直接用于探索实现方案和优化芯片的算术电路,将从初始设计到流片的时间缩短至九个月。
效果如何 实验基于 SemiAnalysis 提供的 InferenceX 公开基准测试,在标称 8k 上下文输入和 1k 输出的设置下,评估了系统在满足延迟要求时的单位功耗吞吐量。测试涵盖了三个不同规模的模型:GPT-OSS 120B、DeepSeek R1 670B(MXFP4 精度)以及 Kimi K2.5 1T(MXFP4 精度)。对比的基线方法是商用领先的 GPU 系统,具体代表路线为额定功耗 1200 瓦的 GB200 和 1400 瓦的 GB300,而 Jalapeño 的额定功耗为 700 瓦(实际测量持续功耗在 550 瓦及以下)。量化结果显示,在所有三个模型上,Jalapeño 在峰值吞吐量下每瓦完成的 AI 工作量是基线系统的 1.5 到 1.9 倍,端到端延迟降低了 1.7 到 3.6 倍;对于高度交互式的工作负载,性能提升了 2.1 到 4.1 倍。在最大规模的 Kimi K2.5 1T 模型上,其峰值每瓦性能提升约 1.5 倍,端到端延迟降低 3.4 倍;在 DeepSeek R1 上,最小词元间延迟(TBT)降低了 4.1 倍(从 5.90 毫秒降至 1.43 毫秒);在 GPT-OSS 120B 上,在对齐基线历史最佳 TBT 的前提下,吞吐量提升了 53.7 倍。作者也坦承了该方案的局限性,即支持每一个新的模型家族仍然需要编写新的内核并进行特定模型的优化,尽管目前借助 AI 生成的注意力机制和混合专家模块代码比人类专家手写的实现快 1.5 到 1.8 倍,但这仅限于特定模块而非完整模型,且系统软件和生产验证目前仍在成熟阶段,计划年底前才能在内部计算基础设施中部署。
主要贡献
当前现有的硬件系统在处理AI工作负载时,通常必须在吞吐量(throughput)和延迟(latency)之间做出权衡。为了解决这一核心问题,OpenAI研发了其首款定制推理芯片Jalapeño,旨在通过单一架构同时提供更高的吞吐量和更低的延迟,从而在单位功耗下处理更多的AI任务,并更快速地返回响应。
该研究的核心创新点在于其全栈协同设计优势(full-stack advantage)。OpenAI将模型、产品、服务软件、芯片、内存、网络和系统结合在一起进行设计,利用真实工作负载的经验来改进技术栈的每一层。此外,Jalapeño的开发过程深度整合了AI能力,不仅利用早期模型协助芯片的设计与启动,还利用最新模型加速芯片的优化和编程。
实验结果表明,该架构具有广泛的模型适用性。在GPT‑OSS 120B、DeepSeek R1和Kimi K2.5 1T(涵盖内部与外部开发的模型)的测试中,Jalapeño在峰值吞吐量下提供的每瓦AI工作量比对比系统高出1.5至1.9倍,端到端延迟降低了1.7至3.6倍。对于高交互性工作负载,其性能提升了2.1至4.1倍。这些性能增益将为客户带来更快的响应、更敏捷的代理(agents)以及更可靠的访问体验,从而推动高能力AI变得更加经济且普及。
背景知识与设计原则
评估标准与交互式代理需求。为了评估匹配用户体验下的性能,团队测量了系统在满足客户和交互式代理所需延迟的前提下,单位功耗能完成的有用AI工作量。由于代理需要按顺序完成多个步骤,延迟会在整个任务中累积,因此该指标尤为重要。
基准测试与性能指标选择。为了解Jalapeño在实际应用中的表现,团队使用了SemiAnalysis提供的公共基准测试InferenceX,该基准测量了提供AI请求的完整过程。团队将Jalapeño与领先的商用AI系统在从高吞吐量服务到高交互、低延迟使用的整个操作范围内进行了对比。结果显示Jalapeño提供了更好的吞吐量、能效和延迟组合。团队认为,相比于每芯片性能,每单位功耗的性能是更为有用的评估标准。
跨模型的能效优势与额定功耗。在所有三个公共模型中,Jalapeño在测试的操作范围内提供了更好的每瓦性能和延迟组合,使其处于帕累托前沿(Pareto frontier)。为了一致地比较不同系统,团队使用各加速器公布的芯片额定功耗对结果进行了归一化处理。Jalapeño的额定功耗为$700$瓦,但在测试的工作负载上,其测量的持续功耗保持在$550$瓦或以下。
前沿模型上的性能扩展。Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T上表现强劲。在测试的最大的公共模型Kimi上,它提供了比对比系统高约1.5倍的峰值每瓦性能和低3.4倍的端到端延迟。内部测试表明,Jalapeño在OpenAI前沿模型上的优势进一步扩大,这表明随着工作负载变得更大、要求更高,该架构的价值也随之显著提升。
方法细节
面向语言模型的软硬件协同设计。Jalapeño从设计之初就聚焦于一个核心问题:如果硬件的主要任务是服务现代及未来的语言模型(特别是交互式代理),应该如何构建它?Jalapeño的性能增益源于围绕真实语言模型工作负载,将芯片、内存、网络、软件和机架级系统进行协同设计。语言模型推理会经历几个具有不同瓶颈的不同阶段。系统处理提示词的预填充(Prefill)阶段是计算密集型的;而系统逐个token生成响应的解码(Decode)阶段则更多地受限于内存带宽。此外,当数据必须在核心和芯片之间移动时,通信也会增加延迟,导致部分处理单元在等待时处于闲置状态。因此,一个仅在某一阶段表现优异的系统,在等待数据或在不同资源之间移动模型状态时,可能会丧失其优势。
最小化数据移动与网络集成架构。团队设计Jalapeño以最小化数据移动和通信延迟。这意味着模型状态(包括生成响应时使用的KV缓存)可以被显式地放置并保留在本地,同时系统会为每个推理阶段激活计算、内存和网络的正确组合。网络是该架构不可或缺的一部分。其大型域允许整个工作负载保持在一个连接的系统内,从而最小化数据移动,并帮助完整的请求从头到尾保持快速高效。最终产生了一个平衡且可替代的加速器,它能够支持不断变化的模型架构,在预填充和解码方面均表现出色,并能随着两者之间平衡的变化而自适应,这是代理工作负载的一个决定性特征。
AI辅助芯片设计与算术电路优化。AI在Jalapeño的开发中发挥了直接作用,通过探索实现方案、缩短设计、测量和验证的循环周期,并持续迭代模型工作负载,使团队能够在九个月内完成从初始设计到流片(tapeout)的过程。此外,AI还协助优化了芯片的算术电路,使团队能够按计划在芯片中融入更多的计算性能。
面向人类与AI的可预测编程模型。Jalapeño被设计为一个清晰、可预测的编程目标,适用于人类和AI。工程师可以通过局部张量(local tensors)、显式通信(explicit communication)和可预测的同步(predictable synchronization)来描述工作。随后,AI可以优化这些工作在整个系统中的映射、放置、调度和协调方式。这种清晰且可预测的结构为AI提供了一种易于处理的方式,以解决传统上困难的并行编程问题。
利用AI加速模型适配与内核优化。支持每个新的模型系列仍然需要新的内核和针对特定模型的优化。团队使用Codex和GPT‑Astra,在两个月内将三个原本不在Jalapeño初始生产计划中的开放权重模型优化至高性能状态。这不仅证明了架构的灵活性,也展示了AI辅助编程的速度。对于选定的GPT‑OSS注意力(attention)和混合专家(mixture-of-experts)模块,AI生成的实现比现有的人类专家编写的实现运行速度快1.5到1.8倍。虽然这些数据仅适用于选定的模块而非完整模型,但它们指向了一个强大的新开发闭环。
实验环境
- 数据集/基准测试:使用SemiAnalysis提供的公共基准测试InferenceX,用于测量服务AI请求的完整端到端过程。
-
模型架构关键参数:
- GPT-OSS 120B (标称配置 8k/1k, STP)
- DeepSeek R1 670B (MXFP4数据格式, 标称配置 8k/1k, STP)
- Kimi K2.5 1T (MXFP4数据格式, 标称配置 8k/1k, STP)
-
硬件配置:
- Jalapeño:封装TDP额定为 $700\text{ W}$,实际测量持续功耗 $\le 550\text{ W}$。
- 对比基准硬件:GB200(封装TDP $1,200\text{ W}$,用于对比GPT-OSS 120B);GB300(封装TDP $1,400\text{ W}$,用于对比DeepSeek R1和Kimi K2.5)。
-
软件配置:利用Codex和GPT-Astra辅助生成和优化底层内核代码。
实验结果
-
GPT-OSS 120B 实验对比:
- 在峰值混合每秒事务数/千瓦(TPS / kW)方面,Jalapeño达到 $85,448$,是对比系统($44,960$)的约 $1.9$ 倍。
- 在端到端延迟方面,Jalapeño耗时 $1.03\text{ s}$,对比系统为 $1.80\text{ s}$(降低约 $1.7$ 倍)。
- 在最小Token生成间隔(TBT)方面,Jalapeño降至 $0.69\text{ ms}$(对应 $1,459\text{ tok/s/user}$),对比系统为 $1.87\text{ ms}$(对应 $535\text{ tok/s/user}$),降低约 $2.7$ 倍。
- 在对比系统的先前最佳TBT($535.28\text{ tok/s/user}$)条件下,Jalapeño的吞吐量达到 $22,935\text{ mixed / kW}$,是对比系统($427\text{ mixed / kW}$)的约 $53.7$ 倍。
-
DeepSeek R1 670B 实验对比:
- 峰值混合TPS / kW:Jalapeño为 $19,641$,对比系统为 $11,781$(提升约 $1.7$ 倍)。
- 端到端延迟:Jalapeño耗时 $1.65\text{ s}$,对比系统为 $5.99\text{ s}$(降低约 $3.6$ 倍)。
- 最小TBT:Jalapeño为 $1.43\text{ ms}$(对应 $700\text{ tok/s/user}$),对比系统为 $5.90\text{ ms}$(对应 $169\text{ tok/s/user}$),降低约 $4.1$ 倍。
- 在先前最佳TBT($169.41\text{ tok/s/user}$)条件下,Jalapeño吞吐量达 $12,258\text{ mixed / kW}$,是对比系统($118\text{ mixed / kW}$)的约 $104.3$ 倍。
-
Kimi K2.5 1T 实验对比:
- 峰值混合TPS / kW:Jalapeño为 $18,195$,对比系统为 $11,862$(提升约 $1.5$ 倍)。
- 端到端延迟:Jalapeño耗时 $1.56\text{ s}$,对比系统为 $5.31\text{ s}$(降低约 $3.4$ 倍)。
- 最小TBT:Jalapeño为 $1.44\text{ ms}$(对应 $694\text{ tok/s/user}$),对比系统为 $5.48\text{ ms}$(对应 $182\text{ tok/s/user}$),降低约 $3.8$ 倍。
- 在先前最佳TBT($182.46\text{ tok/s/user}$)条件下,Jalapeño吞吐量达 $6,744\text{ mixed / kW}$,是对比系统($120\text{ mixed / kW}$)的约 $56.1$ 倍。
结论
Jalapeño通过在相同的功耗和硬件条件下产生更多有用的工作,扩展了高效、低延迟推理的可能性。它不仅在以前仅限于快速模式的能效下实现了超快速模式推理,还在以前仅限于批处理模式的能效下实现了快速模式推理,并进一步提高了批处理模式推理的效率。这有助于OpenAI满足更多需求,降低服务成本,提高运营杠杆率,并支持更广泛的采用和对更好模型的持续投资。
OpenAI计划在年底前将Jalapeño部署到其计算基础设施中。作为多代路线图的第一代产品,其第二代(Gen 2)正在深入开发中,第三代(Gen 3)也已初具雏形,每一代都将基于现有经验进一步提升效率和速度。在准备部署期间,团队正在继续进行生产验证、成熟化软件、准备大规模运营,并验证更多模型的性能。同时,为满足不断增长的AI需求,OpenAI将继续广泛部署NVIDIA及其他合作伙伴的加速器用于训练和推理工作负载,以践行确保通用人工智能造福全人类的使命。
附录
GPT-OSS 120B 帕累托前沿与操作点对比。在针对GPT-OSS 120B(标称8k/1k,STP)的InferenceX测试中,比较了封装TDP为 $700\text{ W}$的Jalapeño与 $1,200\text{ W}$的GB200。结果表明,Jalapeño在峰值混合TPS/kW上达到 $85,448$,是对比基准 $44,960$ 的约 $1.9$ 倍。在端到端延迟方面,Jalapeño实现了 $1.03\text{ s}$,比 $1.80\text{ s}$ 的基准低约 $1.7$ 倍。对于最小TBT,Jalapeño降低至 $0.69\text{ ms}$(对应 $1,459\text{ tok/s/user}$),比基准的 $1.87\text{ ms}$(对应 $535\text{ tok/s/user}$)低约 $2.7$ 倍。此外,在先前最佳TBT($535.28\text{ tok/s/user}$)下,Jalapeño的吞吐量达到 $22,935\text{ mixed / kW}$,是基准 $427\text{ mixed / kW}$ 的约 $53.7$ 倍。
DeepSeek R1 670B 帕累托前沿与操作点对比。在针对DeepSeek R1 MXFP4(标称8k/1k,STP)的测试中,比较了 $700\text{ W}$的Jalapeño与 $1,400\text{ W}$的GB300。Jalapeño的峰值混合TPS/kW为 $19,641$,比基准的 $11,781$ 高约 $1.7$ 倍。端到端延迟为 $1.65\text{ s}$,比基准的 $5.99\text{ s}$ 低约 $3.6$ 倍。最小TBT从基准的 $5.90\text{ ms}$($169\text{ tok/s/user}$)降至 $1.43\text{ ms}$($700\text{ tok/s/user}$),降低了约 $4.1$ 倍。在先前TBT($169.41\text{ tok/s/user}$)下,吞吐量达到 $12,258\text{ mixed / kW}$,是基准 $118\text{ mixed / kW}$ 的约 $104.3$ 倍。
Kimi K2.5 1T 帕累托前沿与操作点对比。在针对Kimi K2.5 MXFP4(标称8k/1k,STP)的测试中,同样对比了 $700\text{ W}$的Jalapeño与 $1,400\text{ W}$的GB300。Jalapeño实现了 $18,195$ 的峰值混合TPS/kW,是基准 $11,862$ 的约 $1.5$ 倍。端到端延迟为 $1.56\text{ s}$,比基准的 $5.31\text{ s}$ 低约 $3.4$ 倍。最小TBT为 $1.44\text{ ms}$($694\text{ tok/s/user}$),比基准的 $5.48\text{ ms}$($182\text{ tok/s/user}$)低约 $3.8$ 倍。在先前TBT($182.46\text{ tok/s/user}$)下,吞吐量为 $6,744\text{ mixed / kW}$,是基准 $120\text{ mixed / kW}$ 的约 $56.1$ 倍。
💬 评论讨论
欢迎在这里分享您的想法和见解!