发表时间: 2026-03 · Blog post by Kyle Aubrey, Farshad Ghodsian (developer.nvidia.com)
作者/机构: Kyle Aubrey, Farshad Ghodsian
一句话结论 本文提出了专为 NVIDIA Vera Rubin 平台设计的机架级推理加速器 NVIDIA Groq 3 LPX,通过将通用 GPU 与专攻低延迟解码的 LPU 组成异构架构,在万亿参数模型上实现了高达 35 倍的每兆瓦推理吞吐量提升。
要解决什么问题 随着大模型向多智能体系统和长上下文推理演进,推理工作负载对基础设施提出了高吞吐量与极低延迟的双重且互斥的要求。原有单一硬件架构无法兼顾两种模式:追求吞吐量的大批处理优化会恶化首字和尾部延迟;而低延迟优化硬件在处理计算密集的长上下文预填充时效率低下。具体到机制层面,推理过程本身是非均一的。预填充阶段需要处理海量输入并构建 KV 缓存,高度依赖密集并行计算和庞大内存容量;而解码阶段是逐个 token 顺序生成的循环,其内部的自注意力机制受限于数据移动和内存带宽,前馈网络(FFN)和混合专家(MoE)层在极小批处理量下对停顿、争用和执行抖动极为敏感。此外,前缀缓存技术的普及虽然降低了预填充成本,却进一步放大了特定请求解码工作的占比。在智能体反复调用工具和推理的循环中,这种解码延迟会不断叠加,导致传统的吞吐量优先架构彻底失效。
怎么做的 核心思路是摒弃单一硬件包揽全流程的做法,采用异构双引擎架构,在解码内部将注意力机制与前馈网络解耦(Attention-FFN Disaggregation,简称 AFD)。该方案由通用计算引擎 NVIDIA Vera Rubin NVL72 GPU 和专用低延迟引擎 NVIDIA Groq 3 LPX 构成。在具体执行中,系统通过 NVIDIA Dynamo 软件层进行任务路由与协同。对于长上下文的预填充任务,直接分配给具备海量高带宽内存的 GPU 以快速构建 KV 缓存。进入解码循环后,GPU 负责在 KV 缓存上执行对计算和容量要求极高的全上下文注意力计算,随后将中间激活值传给 LPX;LPX 接管对延迟极度敏感的 FFN 和稀疏 MoE 专家执行,完成后将输出交还 GPU,形成重复的异构解码循环。为了让 LPX 胜任这一角色,其底层的 NVIDIA Groq 3 LPU 芯片彻底抛弃了传统的动态硬件调度和缓存机制,转而采用由编译器编排的确定性空间执行模型。LPU 将 500MB 的片上 SRAM 作为主要工作存储,提供高达每秒 40 PB 的极高片上内存带宽,并通过显式的数据移动指令,将权重、激活和 KV 状态紧紧贴合计算单元。在机架层面,256 个 LPU 通过近同步的芯片间链路紧密互连,提供每秒 640 TB 的纵向扩展带宽。这种设计消除了自然时钟漂移和不可预测的内存停顿,确保了即使在极小批处理量下也能维持极低且稳定的每 token 延迟。此外,这种异构协同也完美契合推测性解码:由 LPU 凭借极高 SRAM 带宽作为草稿引擎飞速生成候选 token,再交由 GPU 利用其庞大算力进行批量验证,从而在不牺牲验证效率的前提下大幅拉升生成速度。
效果如何 实验评估基于一个 2 万亿参数的混合专家(MoE)模型,并设定了 400K 的超长输入上下文窗口。对比基线为代表上一代通用架构的 NVIDIA GB200 NVL72,以及代表最新一代纯通用架构的 NVIDIA Vera Rubin NVL72。量化结果显示,在要求极高交互性的场景下(即每用户每秒生成 400 个 token),Vera Rubin NVL72 与 Groq 3 LPX 的组合架构展现出统治级优势,其单位能耗吞吐量(每兆瓦每秒 token 数)达到了 GB200 NVL72 基线系统的 35 倍。在经济效益评估中,针对编程助手和多智能体系统等对延迟极度敏感的高级工作负载,这种异构组合架构相比 GB200 NVL72 基线实现了高达 10 倍的单位基础设施年收入潜力增长。作者也明确指出了该方案的适用边界与代价:这种极致的低延迟是以跨异构硬件频繁交换中间激活值为代价的,高度依赖底层编排软件的低开销传输能力;同时,对于纯粹的离线批处理或长上下文吞吐量服务,将任务完全保留在 GPU 上依然是更具成本效益的选择,异构架构主要服务于位于帕累托前沿右上角的超高级交互式 AI 体验。
本文介绍了NVIDIA Groq 3 LPX,这是一款专为NVIDIA Vera Rubin平台设计的全新机架级推理加速器,旨在满足智能体系统(agentic systems)对低延迟和长上下文的需求。随着AI生成速度接近每用户每秒1000个token,AI系统正从对话式交互转向“思想速度”计算,这使得AI能够进行连续的推理、模拟和响应,从而实现实时协作般的体验。这种转变也推动了多智能体系统的发展,其中协同工作的智能体群体能完成远超单个智能体的任务。
核心问题与研究目标:
当前AI工作负载对基础设施提出了双重挑战:既要实现高吞吐量以支持大规模后台服务,又要保证低延迟以提供响应迅速的交互体验。传统单一架构难以同时满足这两个要求。为了解决这一问题,本文提出了一种异构加速架构,将专为低延迟、可预测token生成而优化的NVIDIA Groq 3 LPX与作为通用训练和推理引擎的NVIDIA Vera Rubin NVL72相结合。其目标是创建一个既能保持AI工厂高吞吐量,又能为下一代智能体应用提供快速token生成能力的系统。
主要创新点:
1. 异构推理架构: 提出了Vera Rubin NVL72与LPX相结合的异构架构。Vera Rubin NVL72作为灵活的通用工作引擎,负责训练和推理中的高吞吐量任务(如预填充、解码注意力、长上下文处理等);而LPX则作为专用引擎,专注于加速延迟敏感的解码环节(如FFN和MoE专家执行)。
2. NVIDIA Groq 3 LPX系统: 推出了一款机架级推理加速器,内置256个互连的NVIDIA Groq 3 LPU加速器。该系统强调确定性执行、高片上SRAM带宽(40 PB/s)和高基数片间通信(机架级640 TB/s),以在并发量增加时仍能保持低且稳定的推理延迟。
3. NVIDIA Groq 3 LPU芯片架构: 详细介绍了作为Vera Rubin平台第七款芯片的LPU。其核心设计理念是通过编译器控制,紧密耦合计算、内存和通信,强调确定性执行和显式数据移动,而非单纯追求峰值算力。这使其特别适合解码密集型、延迟敏感的推理场景。
4. NVIDIA Dynamo软件协同: 通过NVIDIA Dynamo软件层实现异构解码的落地。Dynamo负责对请求进行分类、在解耦的后端(GPU和LPU)之间进行任务路由和协同(即AFD循环),将预填充和注意力计算分配给Rubin GPU,将延迟敏感的FFN/MoE解码分配给LPU,从而在保证AI工厂高吞-吐量的同时,实现高响应度的交互体验。
5. 显著的性能与经济效益: 该组合架构宣称可为万亿参数模型带来高达35倍的每兆瓦推理吞吐量提升和高达10倍的收入机会。它通过扩展帕累托前沿,创建了一个新的高级性能层级,能够支持多智能体系统和LLM的推测性解码等高级AI用例。
AI推理性能谱系的多样性。AI推理涵盖了广泛的性能范围。一端是吞吐量优化的服务,如批量文档处理、内容审核、嵌入生成和媒体处理流水线,其目标是最大化每GPU的token数、每瓦特的token数或整体成本效益。这些工作负载通常支持大规模共享服务,包括免费层级和后台AI产品,其中高利用率比单用户响应性更重要。另一端是延迟优化的服务,如编程助手、聊天机器人、语音助手、copilots和交互式智能体,其中延迟对用户是立即可见的。在这些工作负载中,最重要的指标是首个token生成时间(time-to-first-token)、每用户每秒token数(tokens per second per user)和尾部延迟。许多现代AI平台必须同时支持这两种模式,既要运行高吞吐量的后端进行大规模处理,又要提供响应迅速的交互式体验。这种分化是异构推理架构日益重要的原因之一。
使交互式推理更难高效服务的因素。多种趋势使得低延迟交互式推理变得越来越重要,同时也更难高效地提供服务,如表3所示。随着模型产生更长的输出和上下文窗口的增长,更多的工作负载转移到解码阶段,其中token是顺序生成的,响应性直接暴露给用户。
| 驱动力 | 重要性 |
|---|---|
| 低延迟作为产品特性 | 在交互式应用中,响应性不再仅仅是一个基础设施指标;它已成为用户评估产品的一部分。 |
| 更长的推理输出 | 随着模型生成更长的输出和多步思维链,请求中更多的部分转移到顺序token生成。 |
| 前缀缓存 | 重用共享的提示状态可以降低预填充成本,但这也增加了必须快速服务的、针对特定请求的解码工作的相对份额。 |
| 更长的上下文 | 随着上下文的增长,Transformer的自注意力机制越来越受限于数据移动和内存带宽。 |
表3. 四个使传统服务技术在低延迟推理中效果不佳的驱动力
长上下文带来的额外压力。与此同时,更长的上下文增加了对内存带宽和数据移动的压力,而为许多并发用户提供服务则降低了吞吐量优化系统所依赖的批处理效率。因此,为最大化总吞-吐量而优化的系统并不总是最适合需要为每个请求快速、可预测地生成token的工作负载。
智能体AI中的延迟复合效应。在智能体AI中,这一挑战变得更加突出,因为系统在推理、检索、工具使用和推理之间反复循环。在这些循环中,延迟在每一步都会累积,使得稳定的每token性能和强大的尾部延迟行为对于响应迅速的用户体验至关重要。
推理工作负载的非均一性。推理并非单一、统一的工作负载。在一次请求中,预填充(prefill)和解码(decode)对硬件有不同的要求,并且这些要求随批处理大小、上下文长度和模型结构而变化。某些阶段,包括自注意力和稀疏MoE,可能对内存带宽和数据移动高度敏感,而其他阶段,如密集投影和前馈层,在有足够并行性的情况下,可以在吞吐量优化的硬件上高效扩展。在交互式解码中,许多操作以非常小的批处理大小运行,使得延迟对停顿、争用和抖动更为敏感。
单一优化方案的妥协。为整个流水线仅针对一种模式进行优化会迫使系统做出妥协。为大批量下的峰值吞吐量而调整的硬件对于最延迟敏感的执行路径并不理想,而为低延迟执行而优化的硬件对于计算最密集阶段的效率较低。
异构系统扩展帕累托前沿。如图4所示,异构系统结合了两种方法,将低延迟交互性能与高AI工厂吞吐量配对。其结果是一个双引擎架构:GPU为上下文密集的预填充和解码注意力提供高输出,而LPU则加速延迟敏感的解码组件,如FFN/MoE执行。它们共同提高了交互性,而无需放弃AI工厂的吞吐量。

图4. 异构推理扩展了帕累托前沿
Vera Rubin与LPX的结合优势。Vera Rubin和LPX联合了Rubin GPU和LPU的极致性能,可为万亿参数模型提供高达35倍的每兆瓦推理吞吐量和高达10倍的收入机会。LPX与NVIDIA MGX ETL机架架构集成,并与更广泛的Vera Rubin平台保持一致,为数据中心提供了一种在通用基础设施设计内,与Vera Rubin NVL72并行部署专用低延迟推理路径的方法。
LPX系统架构概览。该系统围绕256个互连的NVIDIA Groq 3 LPU加速器构建。其架构强调确定性执行、高片上SRAM带宽和紧密协调的纵向扩展通信,因此即使在并发量增加和请求形态变化时,交互式推理也能保持响应迅速。
异构服务路径。当与Vera Rubin NVL72一同部署时,LPX加速解码循环中对延迟敏感的部分,包括FFN和MoE专家执行,而Rubin GPU则继续处理预填充和解码注意力。它们共同提供了一个异构服务路径,在不牺牲AI工厂吞吐量的情况下提高了交互响应性。

图1. NVIDIA Groq 3 LPX机架级系统
LPX机架级规格。在机架规模上,LPX提供:
| 规格 | NVIDIA Groq 3 LPX |
|---|---|
| AI推理算力 | 315 PFLOPS |
| 总SRAM容量 | 128 GB |
| 片上SRAM带宽 | 40 PB/s |
| 纵向扩展密度 | 256个芯片 |
| 纵向扩展带宽 | 640 TB/s |
表1. NVIDIA Groq 3 LPX规格
异构架构的价值。Vera Rubin NVL72和LPX为AI工厂创造了一个更异构的推理架构——一个既能支持高总token产量,又能提供响应迅速的交互式AI体验的架构。
计算托盘设计。LPX机架级加速器容纳了32个液冷的1U计算托盘,每个托盘都为大规模低延迟推理而设计。每个托盘集成了八个LPU加速器、一个主机处理器和光纤扩展逻辑,采用无电缆设计,简化了机架级部署,并使计算与通信紧密耦合。
互联与通信。LPU芯片到芯片(C2C)链路提供了托盘内的直接通信,通过LPU C2C主干网络实现托盘间通信,并随着系统扩展实现机架间通信。连接性至关重要,因为交互式推理不仅仅关乎原始计算能力,还取决于系统移动数据、协调工作以及在请求流经设备时避免可变延迟的效率。

图2. NVIDIA Groq 3 LPX计算托盘和模块
每托盘资源。每个托盘提供:
| 资源 | 每个LPX托盘 |
|---|---|
| LP30芯片 | 8个 |
| 片上SRAM | 4 GB |
| SRAM带宽 | 1.2 PB/s |
| 通过光纤扩展逻辑的DRAM | 高达256 GB |
| 通过主机CPU的DRAM | 高达128 GB |
| AI推理算力 (FP8) | 9.6 PFLOPS |
| 纵向扩展带宽 | 20 TB/s |
表2. NVIDIA Groq 3 LPX计算托盘规格
系统级设计目标。在系统层面,LPX专为协调开销和抖动会迅速被用户感知的推理场景而构建。随着更多AI应用从离线或吞吐量导向的服务转向交互式生成,这一点尤其重要。要了解LPX如何为该场景进行优化,有必要审视其系统核心的处理器架构:NVIDIA Groq 3 LPU。
LPU核心设计理念。LPX的核心是NVIDIA Groq 3 LPU,它通过编译器控制,紧密耦合计算、内存和通信,旨在提供快速、可预测的token生成。LPU的架构旨在通过编译器控制,紧密耦合计算、内存和通信,以提供快速、可预测的token生成。LPU不只是为峰值算术吞吐量进行优化,而是强调确定性执行、高片上内存带宽和显式数据移动。这些能力对于以解码为主、对延迟敏感的推理场景尤为重要。

图3. NVIDIA Groq 3 LPU芯片架构
以向量为单位的工作组织。LPU中的计算和通信围绕320字节的向量作为工作单元进行组织。算术运算、内存访问和设备间传输都操作于这些固定大小的向量,从而简化了调度和同步。
专用执行模块。专门的执行模块处理不同类别的操作:
* 矩阵执行模块 (MXM):为张量运算提供密集的乘法累加能力,操作于固定的数据类型,具有可预测的吞吐量。
* 向量执行模块 (VXM):处理逐点算术、类型转换和激活函数,每条通道使用一个算术逻辑单元(ALU)网格。
* 交换执行模块 (SXM):执行结构化数据移动,包括向量的排列、旋转、分发和转置。
显式数据移动的优势。通过使数据移动变得显式和可编程,LPU使得内存访问、计算和通信可以重叠执行,而不是依赖硬件启发式方法。
SRAM优先的内存架构。LPU的一个核心元素是MEM块——一个扁平的、SRAM优先的内存架构,其中500MB的高速片上SRAM作为推理的主要工作存储。编译器和运行时不依赖硬件管理的缓存,而是将活动工作集(包括权重、激活和KV状态)放入片上内存,并显式地移动数据。这减少了不可预测的停顿,并通过将最延迟敏感的数据保持在靠近计算单元的位置,帮助提供低且稳定的延迟。
跨LPU扩展。由于片上SRAM容量有限,较大的模型通过并行执行策略(如逐层分区)扩展到多个互连的LPU加速器上,因此整个系统呈现出更大的有效工作集。在这种设计中,性能更多地取决于系统保持计算单元“吃饱”的一致性,而非峰值算术吞吐量。这就是为什么LPX为每个LPU配备了150 TB/s的片上内存带宽和高带宽的纵向扩展芯片间(C2C)通信。
为确定性数据交换设计。为了在多个设备间扩展推理,LPU包含专为确定性数据交换设计的高基数、高速C2C链路。每个LPU通过96条C2C链路连接,每条链路运行速度为112 Gbps,从而实现了简化的LPX纵向扩展拓扑,具有2.5 TB/s的高聚合双向I/O带宽和可预测的通信时序。这对于分布式推理流水线尤其重要,因为在这些流水线中,通信开销否则会成为延迟的主要来源。
空间执行模型。LPU建立在Groq的空间执行模型之上,其中编译器显式地调度计算、数据移动和同步。编译器不依赖运行时的动态硬件调度器,而是依赖硬件中的近同步(plesiosynchronous)芯片间协议,该协议可以消除自然时钟漂移,并将数百个LPU加速器对齐,使其像一个单一协调的系统一样工作。通过可预测的数据到达和定期的软件同步,开发人员可以更直接地对时序进行推理,系统也能够以更高的确定性来协调计算和网络行为。
执行模型的优势。这种执行模型能够实现:
* 内存和计算之间的精确协调。
* 对指令时序的显式控制。
* 在可变工作负载下减少执行抖动。
对实时推理的意义。对于实时推理,这种确定性有助于即使在小批量大小下也能保持首个token生成时间和每token延迟的稳定。
推理工作负载的接力赛比喻。现代推理就像一场接力赛。运行繁重上下文处理环节的硬件不必也负责冲刺到下一个token。Rubin GPU是用于训练和推理的灵活、通用的主力。它们在多种模型大小、批处理方案和服务模式下提供高吞吐量,从长上下文预填充到解码注意力和大规模高并发推理。
LPX的专业化角色。LPX增加了一条专门为快速、延迟敏感的token生成而优化的路径。它们共同实现了一种异构推理设计,在不放弃系统级效率的情况下提高了交互响应性。

图5. 结合极致FLOPS(Rubin GPU)和极致带宽(Groq 3 LPU)的处理器
预填充阶段的特点。预填充阶段主要由处理大型输入和构建KV缓存主导——这是一个受益于密集并行计算和巨大内存容量的工作负载。Vera Rubin NVL72能高效处理这一阶段,特别是对于长上下文工作负载和MoE模型,其中上下文可能很大且高度可变。
解码阶段的异构处理。解码阶段则不同。解码是一个重复的、逐个token的循环,该循环的不同部分会触及不同的瓶颈。在带有LPX的Vera Rubin平台架构中,解码最好被看作一个双引擎循环。GPU处理最能从吞吐量和巨大内存容量中受益的解码工作,例如对累积的KV缓存进行全上下文注意力计算。LPX则加速解码内部的延迟敏感执行部分,例如稀疏MoE专家的前馈网络(FFN)和其他逐点操作。这种划分,通常被称为解码阶段解耦或注意力-FFN解耦(AFD),在解码内部将注意力和FFN分开,并为每个token交换中间激活值,以便每个引擎运行它最适合执行的循环部分。这个AFD循环扩展了帕累托前沿的最高价值操作区域。

图6. AFD解码解释
LPX在解码中的作用。在机架规模及以上,LPX被设计为作为一个紧密协调的计算单元来运行,从而最小化协调开销并减少抖动。这在解码密集、智能体工作流中很有价值,因为在这些工作流中,微小的延迟会在许多模型调用和验证循环中累积。
软件协同的重要性。要使异构解码变得实用,需要能够对请求进行分类、根据延迟目标路由工作、以低开销移动中间激活值,并在突发、可变的流量下保持尾部延迟稳定的软件。https://developer.nvidia.com/blog/nvidia-dynamo-1-production-ready/通过协调跨异构后端的解耦服务和解耦解码,提供了这一编排层。
Dynamo的工作流程。在实践中,Dynamo将预填充路由到GPU工作节点以处理长上下文并构建KV缓存。在解码期间,Dynamo编排AFD循环,其中GPU在累积的KV缓存上运行注意力,中间激活值被传递给LPU进行FFN/MoE执行,然后输出返回到GPU以继续生成token。结果是一个单一、连贯的服务路径,具有更可预测的尾部延迟,同时保持了高AI工厂吞吐量。

图7. Dynamo编排异构计算
Dynamo的功能特性。通过KV感知路由、低开销传输和延迟目标驱动的调度,Dynamo帮助将交互式会话移出长队列,减少跨租户抖动,并在并发和请求形态变化时保持稳定的尾部延迟。其结果是一个生产就绪的异构服务模型,可在保持大规模AI工厂高吞吐量的同时,提供响应迅速的用户体验。
推测性解码的原理。推测性解码(Speculative decoding)是降低LLM推理延迟的一项日益重要的技术。该方法使用一个较小的草稿模型提前生成多个候选token,而一个较大的目标模型则并行验证和接受这些token。当预测匹配时,可以一次性提交多个token,从而显著提高有效每秒token数并减少响应延迟。
LPX在推测性解码中的角色。LPX非常适合在这种架构中充当草稿生成引擎。LPU的确定性执行模型和极高的片上SRAM带宽使其能够非常快速地生成草稿token,从而使草稿模型能够领先于验证器运行。与此同时,像Rubin这样的GPU在大型模型执行任务(如预填充、注意力处理和token验证)方面仍然非常高效。
异构处理器协同。通过将两者配对,系统结合了两种处理器的优势:
* LPX利用其低延迟架构快速生成草稿token。
* Rubin GPU利用高吞吐量计算和巨大的内存容量高效地验证和最终确定token。
分离执行的优势。这种分离使得推测性解码可以跨异构处理器运行,而不是在同一硬件上运行草稿和验证模型。其结果是一个能够提供更快草稿生成而又不牺牲基于GPU的验证效率的系统。

图8. 使用GPU验证和LPU草稿生成的推测性解码
硬件配置:
模型与数据集:
软件配置:
性能指标:

图9. 各种AI工作负载的相对计算和交互性需求,突显了智能体蜂群对高吞吐量和低延迟的需求

图10. 通过Vera Rubin NVL72和Groq 3 LPX解锁一类新的AI体验

图11. NVIDIA Vera Rubin NVL72和LPX提供了10倍的收入机会
开发者面临的三重需求。开发者们越来越多地在构建需要同时满足以下三点的系统:
为工作负载选择合适的路径。LPX拓宽了AI工厂能够高效服务的工作负载范围。在可预测的token生成能改善体验的场景中使用低延迟路径,例如编程助手、具有紧密工具调用循环的智能体工作流、语音交互和实时翻译。将吞吐量优先的工作负载保留在Rubin GPU上,例如批量服务、长上下文吞吐量运行,在这些场景中,高并发和批处理能使GPU保持持续繁忙和高成本效益。
运营思维的转变。运营上的转变在于思维模式。停止为单一的头条指标进行优化,而是开始为一系列真实世界的操作点进行优化。
本文论证了随着AI应用从简单的聊天和批处理推理向复杂的多步智能体工作流演进,响应性已成为一项硬性要求。这些高级应用同时需要高token量和紧密的反馈循环,使得延迟问题尤为突出。为了应对这一挑战,本文提出了一个异构推理架构,将用于高吞吐量长上下文处理的NVIDIA Vera Rubin NVL72与用于低延迟解码的NVIDIA Groq 3 LPX相结合。
该异构方法使得在不牺牲AI工厂整体产出的前提下,显著提升用户交互性成为可能。通过将预填充和注意力计算等任务交由GPU处理,同时将FFN/MoE等延迟敏感的解码部分卸载到专用的LPU上,系统能够扩展性能的帕累托前沿,从而解锁一类全新的高级AI体验。实验结果表明,这种组合在提供高交互性的同时,能实现高达35倍的能效吞吐量提升,并带来高达10倍的收入机会。
对于开发者而言,这意味着可以根据工作负载的特性(响应性 vs. 吞吐量),将其智能地路由到最合适的硬件上,从而为一系列真实世界的应用场景进行优化,而非局限于单一指标。未来的工作展望在于鼓励开发者和系统架构师深入利用这种异构能力,构建更强大、更高效、响应更迅速的下一代AI系统。