NVIDIA 发布 Rubin NVL72?能效大幅跃升的原因解析

opoinstall
2026-08-25
5 min read

NVIDIA 发布 Rubin NVL72?全新的芯片级性能数据显示,在测试的 AgentX 配置下,相比于 GB300 NVL72,Vera Rubin NVL72 平台实现了高达 30 倍的每兆瓦吞吐量提升以及低至 35 分之一的 Agentic AI 工作负载 Token 成本,为受电力限制的 AI 工厂确立了全新的硬件效率基准。随着自主软件代理从实验性的单轮提示词向多步骤生产流水线过渡,计算需求正在迅速膨胀。NVIDIA 引用的 OpenRouter 使用数据显示,单个 agentic 请求消耗的 Token 数量约为普通聊天请求的 15 倍,因为代理会重复查询数据库、检索外部文档、衍生子代理并维护长上下文内存。为了在固定的数据中心电力预算内维持这种高密度吞吐量,服务器架构正朝着极致的软硬件协同设计方向演进。

核心行业重组与新闻解析:面向 Agentic AI 规模化的 Vera Rubin NVL72

核心要点

  • 于 2026 年 8 月 24 日发布的芯片级性能数据显示,在 agentic 编码工作负载上,Vera Rubin NVL72 的每兆瓦吞吐量比 GB300 NVL72 高出多达 30 倍。该结果由 NVIDIA 使用 SemiAnalysis AgentX 工作负载进行测量,目前正等待 SemiAnalysis 的最终评估。
  • 多步骤自主代理消耗的 Token 数量约为标准聊天机器人交互的 15 倍,这使得电力可用性、每兆瓦吞吐量以及 Token 经济学成为 AI 基础设施日益关键的约束条件。
  • 该平台结合了解构式服务(disaggregated serving)、分布式 KV 缓存、感知 KV 的路由、NVFP4 精度、机架级网络以及更广泛的软硬件协同设计,助力 NVIDIA 实现了在测试的 AgentX 配置下相比 GB300 NVL72 降低最高达 35 倍的 Token 成本。

从基础聊天机器人界面向自主 agentic 工作流的转变,正在推动数据中心工程领域的结构性变革。标准的单轮交互通常在 1,000 到 8,000 个 Token 的简洁输入输出边界内运行。相比之下,自主代理执行的是迭代推理循环,其中每个工具调用、数据库检索和中间输出都会累积到后续步骤的上下文窗口中。这种不断累积的上下文会产生不规则的计算爆发,随后是网络延迟期,这对专为静态问答工作负载设计的传统推理服务器构成了巨大压力。

为了在这些真实条件下评估基础设施性能,硬件基准测试正在从固定长度的序列评估转向动态会话重放。NVIDIA 使用 SemiAnalysis AgentX 基准测试套件,测量了来自各大主流模型(包括 DeepSeek V4 Pro、Kimi K3 和 GLM-5.3)重放生产级编码轨迹时的持续系统吞吐量。记录的会话保留了逼真的上下文增长、工具调用间隔以及子代理衍生模式,用以测试硬件将原始电力转化为可用输出的效率,正如 NVIDIA 企业技术公告中所详述的那样。Vera Rubin 的测试结果反映了这些早期测量数据,目前正在等待 SemiAnalysis 的评估。

NVIDIA 技术视觉图,展示了 agentic AI 性能与推理效率指标

Vera Rubin 平台展现出的效率跃升,标志着加速计算平台评估方式的重大转变。在受电力限制的 AI 工厂中,每兆瓦吞吐量决定了总运营容量,而每百万 Token 的成本则决定了毛利率。基准测试结果表明,Blackwell GB300 NVL72 的每兆瓦吞吐量比 Hopper H200 系统高出多达 15 倍,Token 成本降低 10 倍。Vera Rubin 架构进一步延伸了这一效率曲线:在 DeepSeek V4 Pro 工作负载下,针对每秒 160 个 Token 的交互式服务目标,其每兆瓦吞吐量比 GB300 高出多达 30 倍,正如 NVIDIA 开发者博客报告中所报道的那样。

基准测试图表:对比了传统固定序列推理与复杂 agentic 工作负载需求

底层架构解耦:解构式服务与 KV 缓存路由

Rubin 架构的性能提升源于解决了大语言模型推理中预填充(prefill)和解码(decode)阶段之间根本性的物理不匹配问题。预填充阶段处理输入的提示词且受计算能力限制,能够从高并行算术吞吐量中获益。相比之下,解码阶段则按顺序生成 Token,通常对内存带宽更加敏感(特别是在较小的交互式批处理大小下),因为 Token 生成会重复访问模型权重和 KV 状态。

为了消除这种运营摩擦,现代 AI 工厂架构实现了解构式服务。该技术将预填充和解码的执行分散到独立扩展的工作线程池中,使每个阶段都能独立伸缩,并在服务器集群中动态匹配生成速率。

内存优化:分布式缓存与 NVLink 纵向扩展域

在长时间运行的 agentic 会话中,重新计算先前处理过的 Token 会产生巨大的计算冗余。为了保持效率,服务框架在高速互联域中部署了分布式键值(KV)缓存,使 GPU 能够在无需冗余预填充计算的情况下共享和重用上下文。

下图说明了解构式预填充处理与感知 KV 的解码生成之间的架构分离:

[Incoming Multi-Step Agent Request (Cumulative Context)]
                           │
                           ▼
    [ Disaggregated Prefill Worker Pool ] ──> Accelerated Context Encoding
                           │
                           ▼ (Context State Transfer via High-Bandwidth Fabric)
    [ KV-Aware Routing Dispatcher (Dynamo) ] ──> Matches Cached Worker Node
                           │
                           ▼
    [ Disaggregated Decode Worker Pool ]  ──> Low-Latency Token Generation

为了支持这些分布式内存技术,系统采用了第六代互联交换技术,能够提供比现成网络高得多的数据包速率和更低的延迟。通过优化的 CUDA 内核、TensorRT-LLM 等运行时库以及 NVIDIA Dynamo 等协调框架,服务层直接将请求路由至已经持有相关缓存上下文的执行节点。NVIDIA 表示,其 DSX MaxLPS 电源管理技术能够在相同的兆瓦预算内部署多达 40% 的额外 GPU,从而在公用事业规模上进一步最大化吞吐量。

吞吐量对比图:显示 Vera Rubin NVL72 比 GB300 NVL72 提供更高的每兆瓦吞吐量

这种全栈方法展示了一个更广泛的技术原则:扩展现代 AI 工作负载需要在系统的每一层消除冗余计算并优化内存传输。在分布式软件工程中,并行效率原则同样适用于高吞吐量数据管道,其中的架构将数据摄入与状态调和相分离,以防止处理瓶颈。

图表显示 GB300 NVL72 相比上一代 H200 硬件实现了更高的 Token 成本效率

解耦系统与对比分析:单体式服务 vs. 协同设计的 AI 工厂

随着高并发架构向解构式的服务器端处理演进,工程团队必须评估基础设施设计如何影响单位经济效益。部署生产级的 agentic 流水线需要能够最大化每兆瓦吞吐量同时最小化每百万 Token 成本的后端系统。组织必须评估传统的单体式服务实例是否能够支撑 agentic 工作负载,或者是否需要专门的协同设计架构。

架构评估:传统服务 vs. 解构式平台

部署由每个 GPU 同时处理预填充和解码阶段的单体式服务实例,会导致长上下文 agentic 轮次期间严重的资源利用率低下。虽然单体式部署具有初始设置简单的优势,但它们在解码阶段会遭遇计算饥饿,在预填充爆发期间则会面临内存容量限制。相比之下,解构式的 AI 工厂架构能够动态地将上下文编码与 Token 生成解耦,从而在计算和内存域中保持高利用率。

下表概述了不同推理服务方法的核心架构权衡:

架构模型 上下文扩展策略 预填充/解码分配 每兆瓦吞吐量 Token 成本经济性
单体式单节点服务 静态内存分配 紧密耦合 基准 标准高基准
耦合式集群推理 共享资源池 同构工作线程分配 适中(取决于工作负载) 标准集群费率
解构式协同设计 AI 工厂 分布式 KV 缓存路由 完全解构且相互独立 高达 GB300 的 30 倍(已报道) 成本较 GB300 降低高达 35 倍

这种结构性转变代表了一种推理成本通缩:数据中心容量的每一个固定兆瓦都可以产生实质上更多的有用 agentic 工作。通过将硬件加速与智能工作负载路由相结合,运营人员能够在复杂、长周期的任务中维持交互式性能。

全栈 AI 工厂基础设施概览,配备计算、存储和网络服务器机架

工程检查清单与验证排期:优化机架级 Agentic 遥测

为了让基础设施和应用流水线做好迎接高吞吐量 agentic 工作负载的准备,技术和运维团队应当建立结构化的优化实践。

开发者实施检查清单

  • 将预填充与解码工作线程解耦:将计算密集型上下文摄入与内存绑定型 Token 生成分离到独立扩展的工作线程池中,以最大化处理器利用率。
  • 实现感知 KV 缓存的路由:配置 API 网关和负载均衡器,将传入的多轮请求路由到已经存储了相关缓存工作上下文的工作节点。
  • 评估低精度量化:在目标模型上对 NVFP4 和混合精度执行路径进行基准测试,在验证输出推理稳定性的同时减小内存占用。

运维与经济学检查清单

  • 监控每兆瓦吞吐量:跟踪实时工作负载中的持续每兆瓦 Token 数,而不是仅仅依赖孤立的单请求延迟基准。
  • 审计 Token 单位经济效益:测量多步骤 agent trajectory 中每百万 Token 的综合基础设施成本,以维持可持续的利润率。
  • 评估首字延迟(TTFT):监控长上下文预填充阶段的初始响应延迟,以确保高吞吐量批处理不会损害交互式用户体验。

采用这些运维方法能够使工程团队部署响应迅速、长周期的 agentic 系统,同时保持严格的基础设施成本治理。

常见问题解答 (FAQ)

为什么 agentic AI 工作负载消耗的 Token 数量是标准聊天查询的 15 倍?
Agentic 工作流需要多步骤推理、迭代数据库查询、工具调用和子代理协调。由于每一步累积的上下文成为后续轮次的输入,代理会话可能会增长到数十万个 Token,从而成倍增加与单轮聊天交互相比的总 Token 消耗。
解构式服务如何提升 AI 工厂的每兆瓦吞吐量?
解构式服务将计算密集的预填充阶段与内存带宽密集的解码阶段在专门的 GPU 节点之间进行分离。通过针对各自的计算特征优化每个硬件集群并匹配生成速率,该架构消除了处理器空转周期并最大化了能源效率。
Blackwell GB300 NVL72 与 Vera Rubin NVL72 的效率指标有何区别?
虽然 Blackwell GB300 NVL72 在 agentic 基准测试中比 Hopper 架构的每兆瓦吞吐量高出多达 15 倍,但 Vera Rubin NVL72 实现了高达 30 倍的每兆瓦吞吐量提升,并将 Token 成本较 GB300 降低了高达 35 倍,为大型混合专家(MoE)模型开辟了更广阔的效率前沿。

给工程团队的核心要点

Vera Rubin NVL72 平台所展现出的硬件进步凸显了计算基础设施的一个根本性转变:可扩展的 AI 运营需要贯穿芯片、内存架构和软件运行时的全栈协同设计。随着多步骤自主代理成为企业软件的标准界面,传统的单体式服务模型正被解构式、以内存为中心的系统所取代。

对于基础设施架构师和工程领导者而言,驾驭这个高吞吐量时代需要在数据中心流水线中采用解耦的系统原则。通过实施解构式服务、分布式上下文缓存和智能工作负载路由,组织能够构建出色的计算架构,从而在固定的公用电力预算内高效地扩展 agentic 智能。

Share this article