NVIDIA 推出 Rubin NVL72?全新的晶片端效能數據顯示,在經過測試的 AgentX 配置下,Vera Rubin NVL72 平台針對自主式 AI 工作負載,能提供相較於 GB300 NVL72 高達 30 倍的每兆瓦吞吐量,並降低 35 倍的 Token 成本,為受限於電力的 AI 資料中心樹立了全新的硬體效率基準。隨著自主式軟體代理(Autonomous Software Agents)從實驗性質的單輪提示詞轉型為多步驟的正式生產管線,運算需求正急速擴張。NVIDIA 引用的 OpenRouter 使用數據指出,單一自主式請求消耗的 Token 數量大約是一般聊天請求的 15 倍,因為代理需要重複查詢資料庫、檢索外部文件、衍生子代理,並維持長上下文記憶體。為了在固定的資料中心電力額度內維持這種高密度吞吐量,伺服器架構正朝著極致的軟硬體共同設計方向轉變。
核心產業重組與新聞解析:適用於自主式 AI 規模的 Vera Rubin NVL72
重點一覽
- 於 2026 年 8 月 24 日發布的晶片端效能數據顯示,Vera Rubin NVL72 在自主式程式碼編寫工作負載上,每兆瓦吞吐量比 GB300 NVL72 高出達 30 倍。此結果由 NVIDIA 採用 SemiAnalysis AgentX 工作負載進行測量,目前正等待 SemiAnalysis 審查。
- 多步驟自主式代理消耗的 Token 數量大約是標準聊天機器人互動的 15 倍,使得電力供應、每兆瓦吞吐量以及 Token 經濟效益成為 AI 基礎設施日益重要的限制條件。
- 該平台結合了卸載式服務(Disaggregated Serving)、分散式 KV 快取、KV 感知路由、NVFP4 精度、機架級網路以及更廣泛的軟硬體共同設計,促成了 NVIDIA 報導中相較於 GB300 NVL72 在測試的 AgentX 配置下降低達 35 倍的 Token 成本。
從基本的聊天機器人介面轉向自主式代理工作負載,正在推動資料中心工程的結構性轉型。標準的單輪互動通常運作在 1,000 到 8,000 個 Token 之間的簡潔輸入輸出邊界內。相較之下,自主式代理會執行迭代式的推理迴圈,其中每一次的工具呼叫、資料庫檢索與中間輸出,都會累積到後續步驟的上下文視窗中。這種不斷疊加的上下文會產生不規則的運算爆發,隨後是網路延遲期,這對專為靜態提示與回應工作負載所設計的傳統推論伺服器造成了沈重負擔。
為了在這些實際條件下評估基礎設施效能,硬體基準測試正從固定長度的序列評估轉向動態工作階段重播。透過 SemiAnalysis AgentX 基準測試套件,NVIDIA 測量了來自領先模型(包含 DeepSeek V4 Pro、Kimi K3 與 GLM-5.3)重播的生產級程式碼編寫軌跡中的持續系統吞吐量。如 NVIDIA 企業技術公告中所述,所記錄的工作階段保留了實際的上下文成長、工具呼叫間隔以及子代理衍生模式,以測試硬體將原始電力轉換為可用輸出的效率。Vera Rubin 的測試結果反映了這些早期測量數據,目前正等待 SemiAnalysis 審查。

Vera Rubin 平台展現出的效率躍升,證明瞭加速運算平台評估方式的重大轉變。在電力受限的 AI 資料中心中,每兆瓦吞吐量決定瞭總營運容量,而每百萬 Token 成本則主導了毛利率。基準測試結果顯示,Blackwell GB300 NVL72 相較於 Hopper H200 系統,能提供高達 15 倍的每兆瓦吞吐量與 10 倍的較低 Token 成本。正如 NVIDIA 開發者部落格報告中所報導的,Vera Rubin 架構進一步延伸瞭這條效率曲線,在 DeepSeek V4 Pro 工作負載上、以每秒每使用者 160 個 Token 的互動式服務目標下,實現瞭相較於 GB300 高達 30 倍的每兆瓦吞吐量。

底層架構脫鉤:卸載式服務與 KV 快取路由
Rubin 架構的效能提升源自於解決大型語言模型推論在預填充(Prefill)與解碼(Decode)階段之間的根本物理不匹配問題。預填充階段會處理輸入的提示詞且受限於運算能力,可受惠於高平行的算術吞吐量。相較之下,解碼階段會依序產生 Token,通常對記憶體頻寬更為敏感(特別是在較小的互動式批次大小下),因為 Token 產生過程會重複存取模型權重與 KV 狀態。
為了消除此營運摩擦,現代 AI 資料中心架構實作瞭卸載式服務。此技術將預填充與解碼執行作業拆分到獨立擴展的工作池中,讓每個階段都能獨立擴展,並在伺服器叢集中動態匹配產生速率。
記憶體最佳化:分散式快取與 NVLink 擴展網域
在長時間運行的自主式工作階段中,重新計算先前處理過的 Token 會產生巨大的運算冗餘。為了保持效率,服務框架會在高速互連網域中部署分散式鍵值(KV)快取,讓 GPU 能夠共用與重複使用上下文,而無需進行冗餘的預填充計算。
下圖說明瞭卸載式預填充處理與 KV 感知解碼生成之間的架構分離:
[Incoming Multi-Step Agent Request (Cumulative Context)]
│
▼
[ Disaggregated Prefill Worker Pool ] ──> Accelerated Context Encoding
│
▼ (Context State Transfer via High-Bandwidth Fabric)
[ KV-Aware Routing Dispatcher (Dynamo) ] ──> Matches Cached Worker Node
│
▼
[ Disaggregated Decode Worker Pool ] ──> Low-Latency Token Generation
為了支援這些分散式記憶體技術,系統利用瞭第六代互連交換技術,可提供比現成網路更高封包速率與更低延遲。跨越最佳化的 CUDA 核心、執行階段程式庫(如 TensorRT-LLM)以及協調框架(如 NVIDIA Dynamo),服務層會將請求直接路由至已保有相關快取上下文的執行節點。NVIDIA 表示,其 DSX MaxLPS 電源管理技術能在相同的兆瓦預算內配置多達 40% 的 GPU,進一步在公用事業規模下最大化吞吐量。

這種全端方法展現了一個更廣泛的技術原則:擴展現代 AI 工作負載需要在系統的每一個層級消除冗餘運算並最佳化記憶體傳輸。在分散式軟體工程中,平行效率原則適用於高吞吐量資料管線,其中的架構將資料匯入與狀態協調分離,以防止處理瓶頸。

解耦系統與比較分析:單體式服務與共同設計的 AI 資料中心
隨著高並行架構朝著卸載式的伺服器端處理演進,工程團隊必須評估基礎設施設計如何影響單位經濟效益。部署生產級的自主式管線需要後端系統來最大化每兆瓦吞吐量,同時最小化每百萬 Token 的成本。組織必須評估傳統的單體式服務實例是否能維持自主式工作負載,或者是否需要專門的共同設計架構。
架構評估:傳統服務與卸載式平台
部署讓每個 GPU 同時處理預填充與解碼階段的單體式服務實例,會導致在長上下文自主式轉折期間出現嚴重的資源利用率不足。雖然單體式部署提供了簡單的初始設定,但它們在解碼階段會遭受運算匱乏,並在預填充爆發期間面臨記憶體容量限制。相較之下,卸載式 AI 資料中心架構動態地將上下文編碼與 Token 生成解耦,在運算和記憶體網域中維持高效的利用率。
下表概述了不同推論服務方法的關鍵架構權衡:
| 架構模型 | 上下文擴展策略 | 預填充/解碼配置 | 每兆瓦吞吐量 | Token 成本經濟效益 |
|---|---|---|---|---|
| 單體式單節點服務 | 靜態記憶體配置 | 緊密耦合 | 基準 | 標準高基準 |
| 耦合叢集推論 | 共用資源池 | 同質工作者配置 | 中等(視工作負載而定) | 標準叢集費率 |
| 卸載式共同設計 AI 資料中心 | 分散式 KV 快取路由 | 完全卸載且獨立 | 最高達 GB300 的 30 倍(報導值) | 成本比 GB300 低高達 35 倍 |
這種結構性轉變代表了一種推論成本通縮形式:資料中心容量的每一個固定兆瓦都可以產生實質上更多有用的自主式工作。透過將硬體加速與智慧型工作負載路由相結合,營運商可以在複雜的長遠任務中維持互動式效能。

工程檢查清單與驗證時程:最佳化機架級自主式遙測
為了讓資料中心基礎設施與應用程式管線為高吞吐量的自主式工作負載做好準備,技術與營運團隊應建立結構化的最佳化實務。
開發人員實作檢查清單
- 將預填充與解碼工作者解耦:將運算密集的上下文匯入與記憶體密集的 Token 生成拆分到獨立擴展的工作池中,以最大化處理器利用率。
- 實作 KV 快取感知路由:設定 API 閘道器與負載平衡器,將進入的多輪請求路由至已儲存相關快取上下文的工作節點。
- 評估低精度量化:跨目標模型對 NVFP4 與混合精度執行路徑進行基準測試,以減少記憶體佔用,同時驗證輸出推理的穩定性。
營運與經濟學檢查清單
- 監控每兆瓦吞吐量:追蹤即時工作負載的持續每兆瓦 Token 數,而不是單獨依賴孤立的單一請求延遲基準。
- 稽核 Token 單位經濟效益:測量多步驟代理軌跡中每百萬 Token 的總體基礎設施成本,以維持永續的利潤率。
- 分析首字元延遲(TTFT):在長上下文預填充階段監控初始回應延遲,以確保高吞吐量批次處理不會損及互動式使用者體驗。
採用這些營運方法可讓工程團隊部署具備回應能力且長遠的自主式系統,同時維持嚴格的基礎設施成本治理。
常見問題 (FAQ)
為什麼自主式 AI 工作負載消耗的 Token 數量是標準聊天機器人查詢的 15 倍?
卸載式服務如何提升 AI 資料中心的每兆瓦吞吐量?
Blackwell GB300 NVL72 與 Vera Rubin NVL72 的效率指標有何差異?
給工程團隊的關鍵要點
Vera Rubin NVL72 平台展現的硬體進步凸顯瞭運算基礎設施的核心轉變:可擴展的 AI 營運需要在晶片、記憶體架構與軟體執行階段之間進行全端共同設計。隨著多步驟自主式代理成為企業軟體的標準介面,傳統的單體式服務模型正被卸載式、以記憶體為中心的系統所取代。
對於基礎設施架構師與工程領導者而言,在這個高吞吐量時代中前行,需要跨資料中心管線採用解耦系統原則。透過實作卸載式服務、分散式上下文快取與智慧型工作負載路由,組織能夠建構出具備彈性的運算架構,在固定的公用事業電力預算內有效率地擴展自主式智慧。
Share this article



