发表时间: 2026-07 · Blog post by Eduardo Alvarez, Vishal Mehta, Farshad Ghodsian (developer.nvidia.com)
文章标题:NVIDIA Rubin GPU 架构揭秘:赋能代理式 AI 时代
作者/机构:Eduardo Alvarez, Vishal Mehta, Farshad Ghodsian
本文介绍了 NVIDIA Rubin GPU 架构,它是 NVIDIA Vera Rubin 平台的核心,专为代理式(Agentic)AI 工作负载而设计。随着 AI 从离散的模型训练和聊天界面演变为持续产生智能的“AI 工厂”,新的工作负载需要支持推理、规划、工具使用、结果验证和执行复杂多步任务。
核心问题与研究目标:
代理式工作负载的特点是持续的推理过程,而非单一的问答交互。这对计算平台提出了新的要求:
1. 低延迟:每一步推理的延迟要低。
2. 高吞吐量:解码吞吐量要高。
3. 长上下文效率:需要高效处理长上下文注意力机制。
4. 大容量:需要巨大的 KV 缓存容量。
5. 可扩展性:能够在紧密耦合的 GPU 集群中扩展模型。
为了应对这些挑战,NVIDIA 的目标是重新构想数据中心,将其视为一个单一的计算单元,并通过 NVIDIA Vera Rubin 平台及其核心 Rubin GPU 实现这一愿景。
主要创新点与贡献:
1. 性能飞跃:Rubin GPU 旨在提供比 NVIDIA Blackwell 高出 10 倍的单位能耗代理式吞吐量。如图 1 所示,Vera Rubin 平台在代理式推理性能上实现了巨大的代际提升。
2. 核心硬件升级:
* 增强的 Tensor Cores:具有更强的精度灵活性,支持高达 50 petaflops 的 NVFP4 推理性能。
* 第三代 Transformer 引擎:协同 Tensor Cores,高效加速代理式工作负载。
* 全新 HBM4 内存子系统:提供前所未有的内存带宽和容量。
图 1. Pareto 前沿图,展示了 Vera Rubin 平台在代理式推理性能上的 10 倍代际提升(基于内部 2T MoE 工作负载)
GPU 整体结构
Rubin GPU 由两个达到光罩尺寸极限(reticle limited)的计算裸晶(compute die)构成,以实现高密度和高效率。这两个裸晶通过一种名为 NVIDIA 高带宽接口(NVIDIA High-Bandwidth Interface, NV-HBI)的高速裸晶间链路统一封装在单个基板上。
图 2. NVIDIA Rubin GPU 芯片架构
计算核心与精度灵活性
该架构的设计初衷是为了应对代理式工作负载在推理、生成、检索和工具使用之间切换时,如何保持海量计算资源的高效利用。它集成了 3360 亿个晶体管、224 个流式多处理器(SM)和 896 个 Tensor Core,提供了原始的计算密度。同时,第三代 Transformer 引擎能够自适应地在不同数值格式间切换精度。这种灵活性使得 Rubin GPU 能够在保持精度的同时,提供高达 50 petaflops 的 NVFP4 推理性能。
计算资源组织与协调
性能不仅仅取决于 Tensor Core 的吞吐量。Rubin GPU 将计算资源组织成图形处理器集群(GPC),并配备了一个大型的集中式 L2 缓存。GigaThread 引擎负责协调工作,MIG Control 功能可以将 GPU 分区以支持多个工作负载,而 NV-DEC 则用于加速解码。这些功能共同帮助 Rubin GPU 将其高计算密度转化为在大型代理式系统所特有的多样化和动态工作负载下的持续高利用率。
内存与连接性
高利用率还取决于数据到达计算核心的速度。Rubin 集成了高达 288 GB 的 HBM4 内存,由专用的 HBM 控制器和 12-Hi 堆栈驱动,可提供高达 22 TB/s 的峰值带宽。增强的 Tensor Memory Accelerator (TMA) 负责管理复杂数据布局下的高效数据移动。连接性方面,NVIDIA NVLink 6 为全对全(all-to-all)的 GPU 间通信提供了 3,600 GB/s 的扩展带宽至 NVLink Switch;NVLink-C2C 为一致性的 CPU-GPU 通信提供了 1,800 GB/s 的带宽;而 x16 PCIe Gen 6 则提供了高达 256 GB/s 的主机连接速度。
数据安全
大规模的代理式部署必须保护在执行域中流动的数据。通过 TEE-I/O 实现的机密计算(Confidential Computing)旨在保护 AI 工厂中处于静止、传输和使用状态的数据。这些计算、内存、连接和安全功能共同构成了 GPU 级别的基础,以支持那些必须在日益增大的模型和扩展域中保持高效执行的代理式工作负载。
峰值计算能力本身不足以加速代理式推理。实际性能还取决于 GPU 移动数据、执行矩阵运算、处理长上下文注意力以及在依赖内核之间转换的效率。本节探讨了 Rubin GPU 为减少这些关键执行路径中的开销而设计的特性。
MoE 模型的挑战
专家混合(Mixture-of-experts, MoE)模型会动态地将 token 路由到多个专家网络。随着专家数量的增长,高效地定位和移动专家权重对推理性能变得日益重要。
Tensor Memory Accelerator (TMA) 的增强
Rubin GPU 增强了 Tensor Memory Accelerator (TMA),以减少专家密集型模型的数据移动开销。其改进的描述符(descriptor)处理能力使软件能够更有效地处理那些共享通用布局但位于内存不同位置的张量。
内联描述符更新支持
Rubin 通过为 TMA 提供内联描述符更新支持来改进这一点。如图 3 所示,内核无需在内存中修改描述符,而是可以为共享相同布局的张量保留一个统一的描述符,并在运行时直接在 TMA 指令中覆盖内存指针和步长(stride)等字段。
图 3. Rubin 简化了 MoE 描述符共享
MoE 扩展效率
这一特性有助于 MoE 模型随着专家数量的增加而更高效地扩展。通过减少元数据管理和数据移动的开销,Rubin 使更多的 GPU 时间可以用于有价值的推理计算,从而为依赖大型 MoE 模型的代理式工作负载提供更高的吞吐量。
K 维度指令吞吐量加倍
Rubin 通过将其在 $K$ 维度上可处理的数据量加倍,从而使每个时钟周期的 Tensor Core 吞吐量翻倍。这项优化不仅有助于受吞吐量限制的内核,也对受内存和延迟限制的内核有益。
多 GPU 拆分场景下的优势
当模型执行被拆分到多个 GPU 上时,每个 GPU 通常只接收到一小部分输出工作,而规约(reduction)维度仍然很大。
减少循环开销与提高利用率
更大的 $K$ 维度意味着更少的 $K$ 循环迭代。如图 4 所示,一个在 Blackwell 上需要四次 $K$ 迭代的 GEMM(通用矩阵乘法)操作,在 Rubin 上只需两次迭代即可完成。更少的迭代次数减少了循环开销,提高了 Tensor Core 的利用率,并有助于上下文(context)和解码(decode)阶段的 GEMM 在高度张量并行的规模下更高效地运行。
图 4. Rubin 将 K 维度指令吞吐量加倍
长上下文注意力的压力
长上下文和代理式 AI 工作负载给注意力(attention)机制带来了越来越大的压力。随着上下文窗口的增长,模型必须比较更多的 token,对更大的注意力分数矩阵进行归一化,并将这些分数应用于值(value)数据以产生下一层的输出。这使得注意力成为提高每用户每秒 token 数(tokens per second per user)最重要的性能路径之一。
激活稀疏性与自适应压缩的应用
Rubin 通过将激活稀疏性(activation sparsity)与自适应压缩(adaptive compression)和改进的 softmax 吞吐量相结合来加速注意力。在注意力机制中使用 Rubin 新的稀疏性特性的一个简单、安全且有效的方法如下:注意力流水线首先通过密集的 $QK^T$ 计算生成中间注意力分数。然后,Rubin 可以将这些中间数据从 Tensor Memory 加载为结构化的 2:4 稀疏压缩形式,同时生成非零值和有效使用它们所需的元数据,从而降低分数的写入成本和存储需求。这使得后续的注意力阶段可以在更少的数据上进行操作,同时保持模型其余部分所期望的密集输出格式。
图 5. Rubin 的稀疏性特性可应用于注意力块和 MLP 块的激活
压缩中间表示的优势
这种压缩的中间表示在两个关键环节减少了工作量:softmax 和第二次注意力 GEMM。Softmax 可以在非零注意力值上操作,而随后与密集 $V$ 矩阵的乘法可以利用来自 Softmax 的非零值和原始压缩步骤的元数据进行稀疏矩阵乘法(sparse MMA)。其结果是在长上下文注意力最耗费计算资源的部分减少了计算量和数据移动,从而提高了每瓦特 token 数(tokens/watt),且无需改变周围模型流水线的接口。
Softmax 吞吐量提升
Rubin 还提高了 softmax 的吞吐量。随着 Tensor Core 吞吐量的增加,softmax 可能成为瓶颈,因为它依赖于指数运算和跨注意力行的规约操作。Rubin 增加了指数运算的吞吐量,与 Blackwell 基线相比,FP32 吞吐量提升了 2 倍,BF16/FP16 吞吐量提升了 4 倍(如表 1 所示),这有助于 softmax 与更快的矩阵运算保持同步。
| NVIDIA GPU 平台 | FP32 指数吞吐量 (每时钟周期每 SM) |
BF16/FP16 指数吞吐量 (每时钟周期每 SM) |
|---|---|---|
| Blackwell | 1x | 1x |
| Blackwell Ultra | 2x | 2x |
| Rubin | 2x | 4x |
表 1. 从 Blackwell 到 Rubin 的指数吞吐量提升
综合效益
总而言之,这些特性使得 Rubin 的注意力加速不仅仅是单个内核的改进。激活稀疏性减少了中间注意力的工作量,而更快的指数运算则缓解了 softmax 的瓶颈。
核间转换效率的重要性
随着推理在更大模型和更多 GPU 上扩展,原始的 Tensor Core 吞吐量只是性能的一部分。GPU 还需要高效地从一个内核转换到下一个内核。在推理中,这一点尤其重要,因为激活(activations)通常位于关键路径上:一个内核产生激活数据,将其写入内存,然后下一个内核消费这些数据以继续生成下一个 token。
传统执行模式的空闲间隙
传统的生产者-消费者执行模式可能会在 GPU 时间线上产生“气泡”(bubbles)。生产者内核可能提前完成了某些瓦片(tiles)或线程块(thread blocks)的工作,但消费者内核可能要等到一个更广泛的依赖关系解决后才能开始有效工作。Blackwell 的程序化依赖启动(programmatic dependent launch)通过允许消费者内核更早地取得进展来改善了这一点,但依赖的工作仍然可能需要等待所需的激活数据变得可用。
图 6. 生产者-消费者重叠:Blackwell 的批量触发(上)和 Rubin 的瓦片级触发(下)
更细粒度的依赖内核协调
Rubin 使得依赖内核之间能够进行更细粒度的协调。这允许消费者工作在所需的输入数据变得可用时就更早地开始,而不是等待更大范围的生产者工作完成。
性能影响
结果是 GPU 时间线被更紧密地打包,减少了空闲间隙,并改善了依赖内核之间的重叠。这对于代理式推理尤其有价值,因为在这种场景下,激活数据按顺序流经模型,内核到内核的延迟直接影响每用户每秒的 token 数。
随着模型、上下文窗口和 GPU 域的增长,数据移动变得与计算同等重要。Rubin 的设计旨在改善权重、激活、KV 缓存数据和通信流量在 GPU 内部以及跨扩展系统中的流动。以下各节探讨了有助于维持高吞吐量推理的内存和通信创新。
通信与计算的融合
当推理从单个 GPU 扩展到整个机架级系统时,通信成为关键性能路径的一部分。当通信被直接融合(fused)到 GPU 内核内部时,内核不会停止并将控制权交还给 CPU;它会在计算仍在进行时,直接通过 NVLink 向另一个 GPU 写入数据或执行规约操作。
传统 GPU 间通信的开销
传统的 GPU 到 GPU 通信除了移动有效载荷数据外,还需要协调和同步工作。这些步骤会增加延迟并消耗互连带宽,尤其是在分布式推理工作负载中频繁发生通信时。
引入“计数的写入”(Counted Writes)
Rubin 为设备发起的 NVLink 通信引入了“计数的写入”(counted writes)。如图 7 所示,这一功能通过允许接收方 GPU 更有效地跟踪传输完成情况,简化了 GPU 间数据传输的同步过程。
图 7. Rubin 使用“计数的写入”加速 NVLink 通信
低延迟协调机制
带有“计数的写入”的 NVLink 融合通信提供了一种更低延迟的机制来协调 GPU 间的数据移动,有助于保持计算持续进行,而不是等待同步操作。
解码阶段的内存瓶颈
推理的解码(或生成)阶段在根本上是受内存子系统限制的。关键不在于峰值带宽规格,而在于每个内核能多高效地利用整个内存子系统。现代的推理和代理式工作负载通过在解码阶段花费更多的端到端运行时间来放大这一限制:长上下文、大型 KV 缓存和交互式 token 生成使得已实现的内存带宽成为一个关键的性能杠杆。
图 8. 从 Blackwell 到 Rubin 的内存带宽扩展
HBM4 与高效子系统的结合
Rubin 通过将 HBM4 与一个高效的本地化内存子系统相结合来解决这个问题。HBM4 的接口宽度是 HBM3e 的两倍。结合新的内存控制器、与内存生态系统的深度协同工程以及更紧密的计算-内存集成,该子系统提供了高达 22 TB/s 的内存带宽:比 Blackwell 和 Blackwell Ultra 增加了 2.8 倍。
容量与带宽的互补作用
Rubin 每颗 GPU 还提供高达 288 GB 的 HBM4,相对于 Blackwell 增加了可用的片上容量。容量和带宽扮演着不同但互补的角色:
* 容量:支持模型常驻、更大的上下文窗口、更大的 KV 缓存以及更高的并发性,而无需不必要的 KV 缓存卸载。
* 带宽:支持逐个 token 的生成阶段,在此期间,模型权重和 KV 状态必须被足够快地移动,以保持计算引擎的生产力。
* 内存子系统:TMA 和内存局部性策略帮助软件高效地使用内存子系统,为复杂的数据布局提供高实际带宽。
综合作用
高容量、高带宽的 HBM4 对于托管数万亿参数模型、在不卸载 KV 缓存的情况下扩展上下文长度,以及支持高并发、长周期的推理工作负载至关重要。
代理式 AI 基础设施必须优化的不仅仅是单个 GPU;它必须在整个 AI 工厂中有效利用电力、冷却、网络和机架级资源。NVIDIA Vera Rubin NVL72 将 Rubin GPU 架构扩展为一个集成的、具有弹性的机架级执行域。本节探讨了 NVIDIA 如何处理能效、运营可扩展性和系统级可靠性问题。
机架级能效设计
代理式 AI 使能源效率成为一个 AI 工厂级别的问题,而不仅仅是 GPU 的功耗问题。在机架规模上,Vera Rubin NVL72 将计算、网络、液体冷却、功率导向(power steering)和带有储能的智能功率平滑(Intelligent Power Smoothing)技术集成到一个执行域中,旨在在固定的功率范围内最大化有价值的 token 输出。
图 9. 显示功率平滑技术影响的 GPU 功率图
智能功率平滑技术
在 AI 工作负载期间,电力需求可能会急剧变化,产生瞬时峰值,这会闲置可用容量并降低工厂级的吞吐量。Vera Rubin 的电源使用基于充电状态(State-of-Charge, SoC)的智能功率平滑技术来吸收这些波动,与前一代功率平滑技术相比,平均功耗降低约 10%,50 毫秒的峰值功耗降低约 20%。通过提供更稳定的功率曲线,系统可以降低持续的最大功率需求,使支持性的电力基础设施和电网受益,并能在相同的 AI 工厂功率预算内支持更多的计算资源。
DSX MaxLPS 实现功率恢复
在 AI 工厂层面,NVIDIA DSX MaxLPS 将这种方法扩展到 GPU、机架、45°C 液体冷却和工作负载,而 DSX OS 则为调度、生命周期管理和健康自动化提供了操作层。它们共同旨在恢复闲置的电力,并在固定的兆瓦级功率范围内增加有效的计算。DSX MaxLPS 可以使运营商在相同的功率预算下,在节能的操作点上配置多达 40% 的 GPU(如图 10 所示),而对工作负载性能的影响微乎其微。
图 10. 在相同的功率预算下,DSX MaxLPS 可支持多达 40% 的 GPU
Vera Rubin NVL72 机架架构
Vera Rubin NVL72 将 Rubin GPU 扩展为适用于数万亿参数和多机架代理式工作负载的机架级执行域。其第三代 MGX 机架架构结合了无电缆的计算和交换机托盘、45°C 液体冷却、动态机架级功率导向和智能功率平滑技术,使计算、网络、冷却和电力作为一个系统协同工作。可热插拔的 NVLink 交换机托盘和改进的 RAS(可靠性、可用性、可服务性)能力进一步支持了大规模下的弹性运行。
Pod 级扩展基础
这种机架设计是 Pod 级、多机架代理式系统的基础,通过 NVLink 和 NVIDIA Spectrum-X 以太网(参见 https://www.nvidia.com/en-us/networking/spectrumx/)提供开放和灵活的连接。
本文作为一篇技术博客,未提供传统论文格式的详细实验环境,但提到了以下关键配置信息:
硬件配置:
软件配置:
本文通过与前代架构(主要是 Blackwell)的对比,展示了 Rubin 架构的性能优势,具体如下:
注意力机制加速:
矩阵运算效率:通过将 $K$ 维度的指令吞吐量加倍,GEMM 操作的迭代次数减半,减少了循环开销(图 4)。
NVIDIA Rubin GPU 专为代理式 AI 的执行模式而设计,这些模式的特点是长上下文推理、多步生成、分布式 MoE 解码和低延迟交互,并且需要大规模、持续地运行。其计算、内存、网络、机架、电源、冷却和软件等各个层面都经过精心协同设计,旨在让 AI 工厂的更多部分执行有效工作,而不是等待数据、通信或受限于功率。最终,该架构旨在最大化每瓦特的代理式性能——在固定的功率范围内产生更多有价值的 token 和完成更多的 AI 工作。