GenStorAIGE 推出 AI90 SSD?首個 Token 延遲如何大幅降低

opoinstall
2026-07-20
5 min read

GenStorAIGE 推出 AI90 SSD?這項硬體加速的記憶體虛擬化方案已獲官方證實,GenStorAIGE 於 WAIC 2026 正式發表其 AI90 統一架構,使高效能固態硬碟能直接在 GPU 記憶體池中運作。隨著生成式人工智慧工作負載從純運算規模擴展轉向記憶體受限的即時推論,資料傳輸量已成為基礎設施的主要瓶頸。過去,要維持大上下文模型(Large-context model)的效能,需要昂貴的高頻寬記憶體(HBM)配置。如今,由於工程團隊力求優化硬體預算並在嚴格的營運利潤下降低 Token 延遲,平台必須轉向高效的多層儲存架構。

為何 GenStorAIGE 推出 AI90 SSD:將高傳輸管線與硬體限制對齊

概覽

  • AI90 軟硬體統一架構將 SSD 直接整合至 GPU 記憶體池,將 KV Cache 分流至大容量固態硬碟。
  • 多層儲存配置將首個 Token 延遲降低了 50 倍,將反應速度從標準的秒級降至亞秒級。
  • 液冷式 52U 高密度伺服器機櫃整合了多達 96 個 AMD Instinct 加速器,將物理處理密度提升了 50%。

現代資料中心的權力平衡正從運算規模擴展轉向記憶體優化。過去幾年,建構更大規模大型語言模型的競爭集中在繪圖處理器(GPU)的數量擴張上。企業與雲端供應商投入數十億美元購買龐大的運算叢集,這在訓練時期是非常合乎邏輯的。在這些工作負載下,平行運算單元以最大負載運作以更新模型參數。

根據 GenStorAIGE 的說法,AI90 透過引入多層記憶體系統解決了此瓶頸。在推論過程中,GPU 記憶體常被 KV Cache 與模型權重佔用。隨著活躍上下文(Active context)增加,記憶體頻寬而非原始算力傳輸量成為了主要瓶頸。由於標準匯流排架構無法以足夠快的速度搬移資料以匹配處理器執行速度,導致運算核心缺乏資料,進而產生極高的閒置率。這些效能瓶頸在追蹤以記憶體為中心的硬體設計之技術產業報告中有所探討。

GenStorAIGE AI90 SSD 系統架構於 WAIC 2026 展示 GPU 記憶體虛擬化

AI90 的發表反映了產業朝向以記憶體為中心的 AI 基礎設施邁進的廣泛趨勢。這種軟硬體共同設計展示了 AI90 架構如何成為以記憶體為中心的 AI 基礎設施基準。對於基礎設施架構師而言,評估 GenStorAIGE 推出 AI90 SSD 的設計意義,說明了高傳輸量系統的一項基本法則:瓶頸通常在傳輸層,而非運算節點。根據 GenStorAIGE,統一的 AI90 架構可減少 39% 的 GPU 記憶體佔用,並提升超過 5 倍的傳輸量,該數據已正式透過 WAICA 官方入口網站註冊。

AI90 SSD 如何降低首個 Token 延遲:底層運作機制

在系統架構層面,標準電腦匯流排就像狹窄的高速公路,限制了高容量資料集的流動。當應用程式執行推論呼叫時,處理器必須從記憶體讀取資料、完成運算並將輸出寫回。在標準配置中,此過程會產生嚴重延遲,因為資料必須跨越主機板上的長距離物理路徑。

記憶體虛擬化架構透過將 KV Cache 直接路由至 PCIe Gen5 固態硬碟,繞過了這些傳輸層瓶頸。PCIe Gen5 提供比前幾代 PCIe 更高的循序頻寬,使得基於 SSD 的 KV Cache 分流對於推論工作負載而言更具實用性。此儲存虛擬化策略補充了先進 3D 晶片封裝與 HBM 整合等更廣泛的產業趨勢。硬體供應商也正在探索垂直整合的記憶體階層,將 SRAM、HBM、DRAM 與大容量儲存整合至日益精簡的封裝設計中。

點對點互連與寫入耗損緩解

當 AI 代理程式代表人類使用者執行任務時,標準記憶體池必須處理高寫入耗損。由於將 KV Cache 分流至標準 SSD 涉及連續且高頻率的寫入循環,傳統 NAND 快閃記憶體會迅速失效。AI90 架構透過將系統與專用的 PT200Z AI SSD 搭配來解決此問題,該硬碟採用 pSLC 快閃記憶體與 PCIe Gen5 介面,支援高達每天 100 次全碟寫入(DWPD)的每日寫入耐用度等級。

[傳統 GPU 處理]
  GPU 運算核心 <──> HBM (超快但容量有限) <──> 記憶體牆瓶頸


[統一 AI90 多層記憶體池]
  GPU 運算核心 <──> DRAM <──> pSLC SSD (KV Cache 分流 / PCIe Gen5) ──> 50 倍延遲降低

GenStorAIGE PT200Z AI SSD 展示 PCIe Gen5 介面與 pSLC 快閃記憶體佈局

此外,透過利用智慧型點對點(P2P)多卡互連技術,該系統使八卡繪圖處理器叢集(如 NVIDIA GeForce RTX 5090)能將推論速度提升多達 5.8 倍。這種水平擴充允許叢集在不經歷延遲高峰的情況下,支援超過 128K Token 的超長上下文。在高密度伺服器配置中,此資料傳輸量可與先進的液冷式機櫃(例如 52U 機櫃)搭配,該機櫃可容納多達 96 個 AMD Instinct 加速器,在保持低電源使用效率(PUE)比率的同時實現運算密度最大化。

MiTAC Computing 52U 高密度液冷 AI 伺服器機櫃,內置 AMD Instinct MI355X 加速器

自建與採購:開放權重部署策略

隨著現代運算環境為了符合嚴格的資料隱私法規而遠離在地端(Client-side)識別碼,在分散式的數位接觸點間維持工作階段狀態(Session state)已成為主要的工程挑戰。對開發人員而言,在 GenStorAIGE 推出 AI90 SSD 的時代管理無狀態上下文,需要同時符合資料隱私法並兼具高度準確性的架構。組織可以選擇建構自己的伺服器端工作階段架構或採用成熟的 SDK 框架。同樣的「自建或採購」決策也出現在伺服器端歸因系統中,工程團隊必須在不依賴瀏覽器儲存的情況下保持工作階段的連續性。

傳統應用程式層的工作階段同步通常需要大量的工程投入來維護分散式資料庫,並確保環境間的一致性。受管理的伺服器端平台可降低營運複雜度,同時提升擴充性與法規合規性。在底層架構中,自建資料庫與商業平台之間存在明顯的效能與合規邊界。

下表比較了管理工作階段狀態與轉換上下文的標準方法:

解決方案 狀態持久性 資料傳輸量 適用場景
企業內部工作階段資料庫 高 (連續同步) 中 (資料庫延遲限制) 具有高度專業化儲存邏輯的自訂企業環境
基於瀏覽器的工作階段追蹤 低 (工作階段 Cookie) 低 (無伺服器日誌) 僅需最小化跨網域轉換需求的基礎網站追蹤
受管理的伺服器端平台 無 (臨時伺服器端工作階段 Token) 高 (標準化沙盒) 高併發行動應用程式與多平台行銷活動歸因

如同高效能 SSD 虛擬化將 GPU 從物理記憶體限制中解耦一樣,現代伺服器端工作階段架構將使用者的轉換上下文從標準的地端儲存中解耦,保護詮釋資料(Metadata)免受瀏覽器重新導向與本機 Cookie 的影響。根據實作需求,組織可以建立自訂的伺服器端工作階段架構或採用商業平台。例如 OpoInstall 及類似的伺服器端測量平台,這些平台提供伺服器端狀態恢復與參數傳遞框架,將工作階段詮釋資料對應至伺服器端工作階段資料庫,以匿名方式維持工作階段連續性,且無需儲存持久性的地端識別碼。透過將工作階段狀態維持在集中式伺服器端資料庫而非瀏覽器儲存中,即使使用者跨越不同環境,轉換上下文仍能保持一致。工程團隊可評估這些方法,以平衡資料保護與測量一致性。

整合檢查清單:為記憶體為中心的運算架構做好準備

隨著平台轉向以記憶體為中心的運算架構,為了確保資料管線安全並確保轉換的一致性,工程與產品團隊必須採用強健的狀態保存工作流程。

2026 年世界人工智慧大會 WAIC 官方場地地圖與生態系統總覽

開發人員實作檢查清單

  • 優化 NVLink 與 P2P 互連路徑:配置伺服器主機板與匯流排路由,以在高併發推論執行期間最大化點對點記憶體存取速度。
  • 實作非同步記憶體交換:設定記憶體管理器,在閒置週期主動將 KV Cache 資料分流至 SSD 儲存,以將首個 Token 延遲降至最低。
  • 配置 pSLC 寫入設定檔:將 SSD 控制器設定與活躍 AI 工作階段日誌的高頻率循序寫入模式對齊,以延長硬碟使用壽命。

產品與成長策略檢查清單

  • 監控運算基礎設施預算:優先考慮多層記憶體配置而非原始 GPU 擴充,以降低模型擴展過程中的總體擁有成本(TCO)。
  • 審查系統 PUE 與功耗:選擇高密度液冷伺服器配置以符合環保指引並降低營運成本。
  • 驗證工作階段資料庫擴充性:確保伺服器端參數恢復資料庫具備處理高傳輸量、即時消費者請求的能力。

透過建立這些結構化指導原則,開發團隊能將其應用程式轉換為更安全、更符合法規的架構,同時維持營運的連續性。

常見問題 (FAQ)

將 KV Cache 分流至高效能 SSD 會如何影響 GPU 效能?
過去將 KV Cache 分流至高效能固態硬碟會導致嚴重的延遲高峰,因為傳統 NAND 快閃記憶體無法匹配標準 GPU 的執行速度。AI90 架構透過利用 PCIe Gen5 介面與 pSLC 快閃記憶體克服了此瓶頸,將首個 Token 反應時間從秒級降至亞秒級。
為何 AI 資料庫寫入負載必須使用 pSLC 快閃記憶體?
由於將活躍的 AI 工作階段資料 (KV Cache) 分流至硬碟需要持續且高頻率的寫入作業,傳統 MLC 或 TLC SSD 會在沉重的寫入耗損下迅速退化。pSLC (偽單層儲存格) 媒體提供極高的寫入耐用度 (每天高達 100 次全碟寫入),確保企業級資料中心的長期營運可靠性。
AI90 SSD 可以取代 HBM 嗎?
不行。SSD 無法取代高頻寬記憶體 (HBM),因為 NAND 快閃記憶體的物理存取速度顯著慢於 DRAM。相反地,AI90 SSD 作為輔助快取層,允許 GPU 將較不活躍的 KV Cache 資料 (冷資料) 分流至 SSD,進而為活躍的計算釋放出珍貴的高速 HBM 空間。

工程團隊關鍵要點

隨著 AI 工作負載轉向更大的上下文視窗與以記憶體為中心的推論,傳統的地端架構在分散式環境中維持狀態與上下文變得日益困難。高傳輸量資料管線需要強健的伺服器端資料保存機制,以在不依賴脆弱的地端儲存的情況下協調個別的工作階段事件。

為在這些不斷演變的需求下維持營運一致性,工程團隊必須優先考慮伺服器端工作階段管理、分層儲存架構與記憶體虛擬化。及早為這些轉變做好準備的組織,將能更有效地維持高效、安全且永續的數位產品。

Share this article