GenStorAIGEがAI90 SSDを発表:初トークンレイテンシをいかにして短縮したか

opoinstall
2026-07-20
5 min read

GenStorAIGEがAI90 SSDを発表しました。このハードウェアアクセラレーションによるメモリ仮想化スキームは、WAIC 2026にてGenStorAIGEが統合AI90アーキテクチャを導入したことで正式に確認されました。これにより、高性能SSDがGPUメモリプール内で直接機能することが可能になります。生成AIのワークロードが、生データによる計算のスケーリングから、メモリ制約のあるリアルタイム推論へと移行するにつれ、データスループットがインフラストラクチャにおける主要なボトルネックとなっています。従来、大規模コンテキストモデルのパフォーマンスを維持するには、高価な広帯域幅メモリ(HBM)の割り当てが必要でした。今日では、エンジニアリングチームはハードウェア予算を最適化し、厳格な運用マージン下でトークンレイテンシを削減するために、効率的なマルチティアストレージアーキテクチャへの移行を求めています。

GenStorAIGEがAI90 SSDを発表した理由:高スループットパイプラインとハードウェア制限の最適化

概要

  • AI90ソフトウェア・ハードウェア統合アーキテクチャは、SSDをGPUメモリプールに直接統合し、KVキャッシュを大容量SSDにオフロードします。
  • マルチティアストレージ構成により、初トークンレイテンシが50倍削減され、応答速度を標準的な秒単位からサブ秒単位へと改善します。
  • 液体冷却52U高密度サーバーラックは、最大96台のAMD Instinctアクセラレータを統合し、物理処理密度を50%向上させます。

現代のデータセンターにおけるパワーバランスは、計算スケーリングからメモリ最適化へと移行しています。数年間、より大規模な大規模言語モデル(LLM)を構築するための競争は、GPUの純粋な量をスケールすることに焦点が当てられてきました。企業やクラウドプロバイダーは、数十億ドルを投じて大規模な計算クラスターを獲得しましたが、これはトレーニング時代には非常に論理的な判断でした。当時のワークロードでは、並列計算ユニットがモデルパラメータを更新するために最大容量で稼働していたからです。

GenStorAIGEによると、AI90はこのボトルネックに対し、マルチティアメモリシステムを導入することで対処します。推論中、GPUメモリは頻繁にKVキャッシュとモデルのウェイトによって占有されます。アクティブなコンテキストが増大するにつれ、演算スループットではなくメモリ帯域幅が支配的なボトルネックとなります。標準的なバスアーキテクチャではプロセッサの実行速度に合わせてデータを十分に高速に移動できないため、計算コアがデータ不足(スターベーション)状態になり、極めて高いアイドル率が発生します。これらのパフォーマンス上のボトルネックは、メモリ中心のハードウェア設計を追跡する技術産業レポートでも詳述されています。

WAIC 2026でのGPUメモリ仮想化を示すGenStorAIGE AI90 SSDシステムアーキテクチャ

AI90の立ち上げは、メモリ中心のAIインフラへと向かうより広範な産業の動きを反映しています。このハードウェア・ソフトウェアの共同設計は、AI90アーキテクチャがメモリ中心のAIインフラのベンチマークとして浮上していることを示しています。インフラアーキテクトにとって、GenStorAIGEがAI90 SSDを発表したことによる設計上の影響を評価することは、高スループットシステムにおける根本的なルールを明らかにします。それは、ボトルネックは計算ノードではなく、ほぼ常にトランスポート層にあるということです。GenStorAIGEによると、統合AI90アーキテクチャはGPUメモリ使用量を39%削減し、スループットを5倍以上改善します。これはWAICA公式ポータルを通じて公式に登録されています。

AI90 SSDがいかにして初トークンレイテンシを削減するか:内部の仕組み

システムアーキテクチャ層において、標準的なコンピュータバスは幅の狭い高速道路のような役割を果たし、大容量データセットのフローを制限します。アプリケーションが推論呼び出しを実行する際、プロセッサはメモリからデータを読み取り、操作を完了し、結果を書き戻す必要があります。標準的な構成では、データがマザーボード上の物理的に長い距離を移動する必要があるため、このプロセスで深刻なレイテンシが発生します。

メモリ仮想化アーキテクチャは、KVキャッシュをPCIe Gen5 SSDへ直接ルーティングすることで、これらのトランスポート層のボトルネックをバイパスします。PCIe Gen5は以前の世代よりも大幅に高いシーケンシャル帯域幅を提供するため、推論ワークロードにおいてSSDベースのKVキャッシュオフロードが現実的なものとなります。このストレージ仮想化戦略は、高度な3DチップパッケージングやHBM統合といった広範な業界トレンドを補完するものです。ハードウェアベンダーは、SRAM、HBM、DRAM、大容量ストレージをますますコンパクトなパッケージデザインに組み合わせた、垂直統合型のメモリ階層も検討しています。

ピア・ツー・ピア相互接続と書き込み摩耗の緩和

AIエージェントがユーザーの代理でタスクを実行する場合、標準的なメモリプールは高い書き込み摩耗を処理しなければなりません。KVキャッシュを標準的なSSDにオフロードすると、高頻度の書き込みサイクルが継続するため、従来のNANDフラッシュメディアは急速に故障してしまいます。AI90アーキテクチャは、システムをpSLCフラッシュメディアベースの専用「PT200Z AI SSD」と組み合わせることでこれに対処しています。これにはPCIe Gen5インターフェースが採用されており、1日あたり最大100回のドライブ書き込み(DWPD)という高い耐久性をサポートしています。

[従来のGPU処理]
  GPU計算コア <──> HBM(超高速だが容量制限あり) <──> メモリの壁ボトルネック


[統合型AI90マルチティアメモリプール]
  GPU計算コア <──> DRAM <──> pSLC SSD(KVキャッシュオフロード / PCIe Gen5) ──> 50倍のレイテンシ短縮

PCIe Gen5インターフェースとpSLCフラッシュメディアレイアウトを示すGenStorAIGE PT200Z AI SSD

さらに、インテリジェントなピア・ツー・ピア(P2P)マルチカード相互接続技術を活用することで、このシステムは8枚のグラフィックスプロセッサクラスター(NVIDIA GeForce RTX 5090など)の推論速度を最大5.8倍までスケールさせることが可能です。この水平方向の拡張により、クラスターは128Kトークンを超える極めて長いコンテキストを、レイテンシの急増なしでサポートできます。高密度サーバー構成では、このデータスループットを52Uキャビネットなどの高度な液体冷却ラックと組み合わせることができ、最大96台のAMD Instinctアクセラレータを搭載して、低い電力使用効率(PUE)を維持しながら計算密度を最大化します。

AMD Instinct MI355Xアクセラレータを搭載したMiTAC Computing製52U高密度液体冷却AIサーバーラック

構築か購入か:オープンウェイト展開戦略

現代のコンピューティング環境が、厳格なデータプライバシー規制を遵守するためにローカルのクライアント側識別子から離れる中、分散されたデジタル接点間でセッション状態を維持することが主要なエンジニアリング上の課題となっています。開発者にとって、GenStorAIGEのAI90 SSD時代においてステートレスなコンテキストを管理するには、データプライバシー法に準拠しつつ、極めて高い精度を持つアーキテクチャが必要です。組織は、独自のカスタムサーバーサイドセッションアーキテクチャを構築するか、成熟したSDKフレームワークを採用するかを選択できます。この「構築か購入か」の意思決定は、サーバーサイドのアトリビューションシステムでも同様であり、エンジニアリングチームはブラウザストレージに頼ることなくセッションの連続性を維持しなければなりません。

従来のアプリケーション層におけるセッション同期は、分散データベースを維持し、環境間で整合性を確保するために多大なエンジニアリングの労力を必要とすることがよくあります。管理されたサーバーサイドプラットフォームは、運用の複雑性を軽減しつつ、スケーラビリティと規制コンプライアンスを向上させます。基盤となるアーキテクチャにおいては、自社構築データベースと商用プラットフォームとの間で、パフォーマンスとコンプライアンス上の明確な境界が存在します。

以下の表は、セッション状態とコンバージョンのコンテキストを管理するための標準的な方法論を比較したものです:

ソリューション 状態の永続性 データスループット 最適な用途
社内セッションデータベース 高(継続的な同期) 中(DBのレイテンシ制限あり) 高度に専門化されたストレージロジックを持つカスタム企業環境
ブラウザベースのセッション追跡 低(セッションCookie) 低(サーバーログなし) ドメイン横断的なコンバージョン要件が最小限の基本的なWebサイト追跡
管理型サーバーサイドプラットフォーム なし(一時的なサーバーサイドセッション・トークン) 高(標準化されたサンドボックス) 高コンカレンシーのモバイルアプリおよびマルチプラットフォーム・キャンペーンのアトリビューション

高性能SSD仮想化がGPUを物理的なメモリ制限から解放するように、現代のサーバーサイドセッションアーキテクチャは、ユーザーのコンバージョンコンテキストを標準的なクライアントサイドストレージから分離し、メタデータをブラウザベースのリダイレクトやローカルCookieから保護します。実装要件に応じて、組織は独自のカスタムサーバーサイドセッションアーキテクチャを構築するか、商用プラットフォームを採用することができます。OpoInstallのようなサーバーサイド計測プラットフォームは、サーバーサイドの状態復元およびパラメータ受け渡しフレームワークを提供し、セッションメタデータをサーバーサイドのセッションデータベースにマッピングすることで、永続的なクライアント側識別子を保存することなく匿名でセッションの連続性を維持します。ブラウザストレージではなく中央のサーバーサイドデータベースでセッション状態を保持することで、ユーザーが異なる環境間を移動しても、コンバージョンコンテキストは一貫性を保ちます。エンジニアリングチームは、データ保護と計測の整合性のバランスをとるために、これらのアプローチを評価することができます。

統合チェックリスト:メモリ中心コンピューティングへのアーキテクチャ準備

プラットフォームがメモリ中心のコンピューティングアーキテクチャへ移行する中で、データパイプラインを保護し、コンバージョンの整合性を確保するために、エンジニアリングチームおよびプロダクトチームは強固な状態保持ワークフローを採用する必要があります。

世界人工知能会議 WAIC 2026公式会場マップとエコシステムの概要

開発者の実装チェックリスト

  • NVLinkおよびP2P相互接続経路の最適化:高コンカレンシーな推論実行時にピア・ツー・ピアのメモリアクセス速度を最大化するよう、サーバーマザーボードとバスルーティングを構成してください。
  • 非同期メモリ・スワッピングの実装:アイドルサイクル中にKVキャッシュデータをSSDストレージへプロアクティブにオフロードするメモリマネージャーを設定し、初トークンレイテンシを最小化してください。
  • pSLC書き込みプロファイルの構成:SSDコントローラーの設定を、アクティブなAIセッションログの高頻度・シーケンシャル書き込みパターンに適合させ、ドライブ寿命を延ばしてください。

プロダクト・成長戦略チェックリスト

  • 計算インフラ予算の監視:モデルのスケーリングにおける総所有コスト(TCO)を削減するため、生データのGPU拡張よりもマルチティアメモリ構成を優先してください。
  • システムPUEおよび消費電力の監査:環境ガイドラインを満たし、運用コストを削減するために、高密度の液体冷却サーバー構成を選択してください。
  • セッションデータベースのスケーラビリティ検証:サーバーサイドのパラメータ復元データベースが、高スループットかつリアルタイムの消費者リクエストを処理できる能力があることを確認してください。

これらの構造的なガイドラインを確立することで、開発チームは運用の連続性を維持しながら、より安全で準拠性の高いアーキテクチャへとアプリケーションを移行できます。

よくある質問 (FAQ)

KVキャッシュを高性能SSDにオフロードすることは、GPUパフォーマンスにどのような影響を与えますか?
KVキャッシュを高性能SSDにオフロードすることは、伝統的に深刻なレイテンシの急増を招いてきました。これは、従来のNANDフラッシュメモリが標準的なGPUの実行速度に追いつけなかったためです。AI90アーキテクチャは、PCIe Gen5インターフェースとpSLCフラッシュメディアを活用することでこのボトルネックを克服し、初トークンの応答時間を秒単位からサブ秒単位へと短縮しました。
AIデータベースの書き込み負荷にpSLCフラッシュメディアが必要な理由は何ですか?
アクティブなAIセッションデータ(KVキャッシュ)のオフロードには高頻度で継続的な書き込み操作が必要となるため、従来のMLCやTLC SSDでは激しい書き込み摩耗により急速に劣化してしまいます。pSLC(擬似シングルレベルセル)メディアは、極めて高い書き込み耐久性(最大100 DWPD)を提供し、エンタープライズデータセンターにおいて長期的な運用信頼性を保証します。
AI90 SSDはHBMを置き換えられますか?
いいえ。SSDが広帯域幅メモリ(HBM)を置き換えることはできません。NANDフラッシュの物理的なアクセス速度はDRAMよりも大幅に遅いためです。その代わり、AI90 SSDは補助的なキャッシュ層として機能し、GPUがアクティブでないKVキャッシュデータ(コールドデータ)をSSDへスムーズにオフロードすることで、貴重な高速HBM領域をアクティブな計算のために解放できるようにします。

エンジニアリングチームへの重要なポイント

AIワークロードがより大きなコンテキストウィンドウとメモリ中心の推論へとシフトする中、従来のクライアントサイドアーキテクチャでは、分散環境全体で状態とコンテキストを維持することが困難になっています。高スループットのデータパイプラインには、脆弱なクライアントサイドストレージに依存せず、個別のセッションイベントを調整するための強固なサーバーサイドデータ保存が必要です。

これらの進化する要件の下で運用の一貫性を維持するために、エンジニアリングチームはサーバーサイドのセッション管理、階層型ストレージアーキテクチャ、およびメモリ仮想化を優先する必要があります。早期にこれらの変化に備える組織は、効率的で安全かつ持続可能なデジタルプロダクトを維持する上で、より有利な立場を築けるでしょう。

Share this article