NVIDIAがRubin NVL72を出荷?新しいオンシリコンのパフォーマンスデータにより、Vera Rubin NVL72プラットフォームは、テストされたAgentX構成においてGB300 NVL72と比較して、メガワットあたり最大30倍のスループット向上と35倍のトークンコスト削減を実現することが明らかになりました。これにより、電力に制約のあるAIファクトリー向けに新たなハードウェア効率の基準が確立されます。自律型ソフトウェアエージェントが実験的な単一ターンのプロンプトからマルチステップのプロダクションパイプラインへと移行するにつれて、計算需要は急速に拡大しています。NVIDIAが引用するOpenRouterの使用データによると、単一のエージェントリクエストは、エージェントがデータベースへの繰り返しクエリ、外部ドキュメントの取得、サブエージェントの起動、および長文コンテキストメモリの維持を行うため、通常のチャットリクエストの約15倍のトークンを消費します。固定されたデータセンターの電力制限内でこの高密度スループットを維持するため、サーバーアーキテクチャは極限のハードウェアとソフトウェアの協調設計へと移行しつつあります。
業界の主要な再編とニュースの分析:自律型AIスケールに向けたVera Rubin NVL72
概要
- 2026年8月24日に公開されたオンシリコンのパフォーマンスデータによると、Vera Rubin NVL72は、エージェント型コーディングワークロードにおいてGB300 NVL72よりもメガワットあたり最大30倍高いスループットを実現しています。この結果は、NVIDIAがSemiAnalysis AgentXワークロードを使用して測定したものであり、現在SemiAnalysisによるレビュー中です。
- マルチステップの自律型エージェントは標準的なチャットボットのやり取りの約15倍のトークンを消費するため、電力の可用性、メガワットあたりのスループット、およびトークン経済性は、AIインフラストラクチャにとってますます重要な制約となっています。
- このプラットフォームは、分離型サービング、分散型KVキャッシング、KV認識型ルーティング、NVFP4精度、ラック規模のネットワーキング、およびより広範なハードウェアとソフトウェアの協調設計を統合しており、テストされたAgentX構成の下でのGB300 NVL72と比較して、NVIDIAが報告する最大35倍のトークンコスト削減に寄与しています。
基本的なチャットボットインターフェースから自律型エージェントワークフローへの移行は、データセンターエンジニアリングの構造的変革を推進しています。標準的な単一ターンのやり取りは、通常、1,000〜8,000トークンの簡潔な入出力境界内で動作します。対照的に、自律型エージェントは、すべてのツール呼び出し、データベース取得、および中間出力が後続のステップのコンテキストウィンドウに累積される反復的な推論ループを実行します。この複合的なコンテキストにより、計算の不規則なバーストの後にネットワーク遅延の期間が発生し、静的なプロンプトとレスポンスのワークロード向けに設計された従来の推論サーバーに負担がかかります。
これらの現実的な条件下でインフラストラクチャのパフォーマンスを評価するために、ハードウェアベンチマークは、固定長のシーケンス評価から動的なセッションリプレイへと移行しています。SemiAnalysis AgentXベンチマークスイートを使用して、NVIDIAは、DeepSeek V4 Pro、Kimi K3、GLM-5.3などの主要モデルからのリプレイされた本番スタイルのコーディング軌道全体で、持続的なシステムスループットを測定しました。NVIDIAコーポレートテクニカルアナウンスで詳述されているように、記録されたセッションは、ハードウェアが未加工の電力を有用な出力にどれほど効率的に変換するかをテストするために、現実的なコンテキストの成長、ツール呼び出しの間隔、およびサブエージェントの起動パターンを保持します。Vera Rubinの結果はこれらの初期測定を反映しており、現在SemiAnalysisによるレビュー中です。

Vera Rubinプラットフォーム全体で測定された効率の飛躍は、アクセラレーテッドコンピューティングプラットフォームの評価方法における大きな変化を示しています。電力に制約のあるAIファクトリーでは、メガワットあたりのスループットが総運用能力を決定し、100万トークンあたりのコストが粗利益を左右します。ベンチマーク結果は、Blackwell GB300 NVL72がHopper H200システムと比較して、メガワットあたり最大15倍のスループット向上と10倍のトークンコスト削減を実現することを示しています。NVIDIA Developer Blogレポートで報告されているように、Vera Rubinアーキテクチャはこの効率曲線さらに拡張し、DeepSeek V4 Proワークロードでユーザーあたり毎秒160トークンのインタラクティブなサービングターゲットにおいて、GB300よりも最大30倍高いメガワットあたりスループットを実現しています。

内部のアーキテクチャ上の乖離:分離型サービングとKVキャッシュルーティング
Rubinアーキテクチャのパフォーマンス向上は、大規模言語モデルの推論におけるプリフィル(事前充填)ステージとデコードステージの間の基本的な物理的不整合に対処することに起因しています。プリフィルフェーズは、受信したプロンプトを処理し、計算バウンドであり、高い並列算術スループットの恩恵を受けます。対照的に、デコードフェーズはトークンをシーケンシャルに生成し、トークン生成がモデルの重みとKV状態に繰り返しアクセスするため、特にインタラクティブなバッチサイズが小さい場合、通常はメモリ帯域幅により敏感になります。
この運用上の摩擦を解消するために、最新のAIファクトリーアーキテクチャは分離型サービングを実装しています。この技術により、プリフィルとデコードの実行が独立して拡張されたワーカープール全体で分離され、各ステージが独立して拡張し、サーバークラスター全体で生成レートを動的に一致させることができます。
メモリの最適化:分散キャッシングとNVLinkスケールアップドメイン
長期間実行されるエージェントセッションでは、以前に処理されたトークンを再計算すると、膨大な計算の冗長性が生じます。効率を維持するために、サービングフレームワークは高速インターコネクトドメイン全体に分散キーバリュー(KV)キャッシングを展開し、GPUが冗長なプリフィル計算なしでコンテキストを共有および再利用できるようにします。
以下の図は、分離されたプリフィル処理とKV認識型のデコード生成の間のアーキテクチャ上の分離を示しています。
[受信マルチステップエージェントリクエスト(累積コンテキスト)]
│
▼
[ 分離型プリフィルワーカープール ] ──> 高速化されたコンテキストエンコーディング
│
▼ (高帯域幅ファブリックを介したコンテキスト状態転送)
[ KV認識型ルーティングディスパッチャー (Dynamo) ] ──> キャッシュされたワーカーノードと一致
│
▼
[ 分離型デコードワーカープール ] ──> 低遅延トークン生成
これらの分散メモリ技術をサポートするために、このシステムは、市販のネットワーキングよりも大幅に高いパケットレートと低い遅延を提供する第6世代インターコネクトスイッチングを利用しています。最適化されたCUDAカーネル、TensorRT-LLMなどのランタイムライブラリ、NVIDIA Dynamoなどの調整フレームワークにまたがり、サービングレイヤーは、関連するキャッシュされたコンテキストをすでに保持している実行ノードに直接リクエストをルーティングします。NVIDIAは、DSX MaxLPS電力管理技術により、同じメガワットの予算内で最大40%多くのGPUをプロビジョニングでき、ユーティリティスケールでのスループットをさらに最大化できると述べています。

このフルスタックアプローチは、より広範な技術的原則を示しています。近代的なAIワークロードの拡大には、システム全体のあらゆるレイヤーで冗長な計算を排除し、メモリ転送を最適化することが求められます。分散ソフトウェアエンジニアリングでは、並列効率の原則が高スループットのデータパイプライン全体に適用され、アーキテクチャは取り込みを状態の調整から分離して処理のボトルネックを防ぎます。

分離されたシステムと比較分析:モノリシックサービング対協調設計されたAIファクトリー
高同時実行アーキテクチャが分離されたサーバーサイド処理へと進化するにつれて、エンジニアリングチームはインフラストラクチャの設計がユニットエコノミクスにどのように影響するかを評価する必要があります。本番グレードのエージェントパイプラインをデプロイするには、メガワットあたりのスループットを最大化し、100万トークンあたりのコストを最小化するバックエンドシステムが必要です。組織は、従来のモノリシックサービングインスタンスがエージェントワークロードを維持できるかどうか、または専用の協調設計されたアーキテクチャが必要かどうかを評価する必要があります。
アーキテクチャの評価:従来のサービング対分離型プラットフォーム
各GPUがプリフィルステージとデコードステージの両方を処理するモノリシックサービングインスタンスをデプロイすると、長文コンテキストのエージェントのターン中に深刻なリソースの未活用につながります。モノリシックなデプロイは初期設定が簡単ですが、デコードフェーズ中の計算の飢餓と、プリフィルバースト中のメモリ容量の制限に苦しみます。対照的に、分離されたAIファクトリーアーキテクチャは、コンテキストエンコーディングをトークン生成から動的に切り離し、計算ドメインとメモリドメインの両方で高い稼働率を維持します。
以下の表は、さまざまな推論サービング手法における主要なアーキテクチャ上のトレードオフの概要を示しています。
| アーキテクチャモデル | コンテキストスケーリング戦略 | プリフィル/デコード割り当て | メガワットあたりのスループット | トークンコストエコノミクス |
|---|---|---|---|---|
| モノリシックシングルノードサービング | 静的メモリ割り当て | 密結合 | ベースライン | 標準的な高ベースライン |
| 結合型クラスタ推論 | 共有リソースプール | 均質なワーカー割り当て | 中程度(ワークロード依存) | 標準クラスタレート |
| 分離型協調設計AIファクトリー | 分散KVキャッシュルーティング | 完全分離および独立 | GB300と比較して最大30倍(報告値) | GB300と比較して最大35倍低いコスト |
この構造的シフトは、推論コストのデフレの一形態を表しています。データセンター容量の固定された各メガワットは、実質的に多くの有用なエージェント作業を生成できます。ハードウェアアクセラレーションとインテリジェントなワークロードルーティングを組み合わせることで、オペレーターは複雑で長期にわたるタスク全体でインタラクティブなパフォーマンスを維持できます。

エンジニアリングチェックリストと検証スケジュール:ラック規模のエージェントテレメトリーの最適化
データセンターのインフラストラクチャとアプリケーションパイプラインを高スループットのエージェントワークロードに向けて準備するために、技術および運用チームは構造化された最適化プラクティスを確立する必要があります。
開発者向け実装チェックリスト
- プリフィルとデコードワーカーの分離:プロセッサの稼働率を最大化するために、計算負荷の高いコンテキストの取り込みと、メモリバインドされたトークン生成を、独立してスケーリングされたワーカープールに分離します。
- KVキャッシュ認識型ルーティングの実装:APIゲートウェイとロードバランサーを構成して、関連するキャッシュされたコンテキストをすでに保存しているワーカーノードに、受信するマルチターンプリクエストをルーティングします。
- 低精度量子化の評価:ターゲットモデル全体のNVFP4および混合精度実行パスをベンチマークして、出力推論の安定性を検証しながらメモリフットプリントを削減します。
運用と経済性のチェックリスト
- メガワットあたりのスループットの監視:単一リクエストの分離されたレイテンシーベンチマークだけに頼るのではなく、ライブワークロード全体で持続的なメガワットあたりのトークンを追跡します。
- トークンユニットエコノミクスの監査:持続可能な利益率を維持するために、マルチステップのエージェント軌道全体で100万トークンあたりの総インフラストラクチャコストを測定します。
- 初回トークン生成時間(TTFT)のプロファイリング:長文コンテキストのプリフィルフェーズ中の初期応答遅延を監視して、高スループットのバッチ処理がインタラクティブなユーザーエクスペリエンスを損なわないようにします。
これらの運用方法を採用することにより、エンジニアリングチームは、厳格なインフラストラクチャコストガバナンスを維持しながら、応答性の高い長期的なエージェントシステムを展開できるようになります。
よくある質問(FAQ)
エージェント型AIワークロードが標準的なチャットボットクエリの15倍ものトークンを消費するのはなぜですか?
分離型サービングは、AIファクトリーのメガワットあたりのスループットをどのように向上させますか?
Blackwell GB300 NVL72とVera Rubin NVL72の効率指標の違いは何ですか?
エンジニアリングチーム向けの主要なポイント
Vera Rubin NVL72プラットフォーム全体で示されたハードウェアの進歩は、コンピューティングインフラストラクチャにおける本質的なシフトを浮き彫りにしています。スケーラブルなAI運用には、シリコン、メモリアーキテクチャ、およびソフトウェアランタイム全体にわたるフルスタックの協調設計が必要です。マルチステップの自律型エージェントがエンタープライズソフトウェアの標準インターフェースになるにつれて、従来のモノリシックなサービングモデルは、分離されたメモリ中心のシステムに置き換えられています。
インフラストラクチャアーキテクトやエンジニアリングリーダーにとって、この高スループットの時代をナビゲートするには、データセンターパイプライン全体で分離されたシステム原則を採用する必要があります。分離型サービング、分散型コンテキストキャッシング、およびインテリジェントなワークロードルーティングを実装することで、組織は、固定された電力予算内でエージェントの知性を効率的にスケーリングできる堅牢なコンピューティングアーキテクチャを構築できます。
Share this article


