GenStorAIGE 发布 AI90 SSD?首个 Token 延迟大幅降低的奥秘

opoinstall
2026-07-20
5 min read

GenStorAIGE 发布了 AI90 SSD?这项硬件加速的内存虚拟化方案已获正式确认,GenStorAIGE 在 WAIC 2026 上推出了统一的 AI90 架构,使高性能固态硬盘能够直接在 GPU 内存池中发挥作用。随着生成式 AI 工作负载从单纯的算力扩展转向受内存制约的实时推理,数据吞吐量已成为基础设施的首要瓶颈。传统上,维持大模型性能需要昂贵的高带宽内存 (HBM) 分配。如今,为了在严格的运营预算下优化硬件成本并降低 Token 延迟,平台必须转向高效的多层存储架构。

为什么 GenStorAIGE 发布 AI90 SSD:将高吞吐管道与硬件极限对齐

核心速览

  • AI90 软硬件统一架构将 SSD 直接集成至 GPU 内存池中,将 KV Cache 卸载至大容量固态硬盘。
  • 多层存储配置可将首个 Token 的响应延迟降低 50 倍,将响应速度从通常的秒级提升至亚秒级。
  • 液冷 52U 高密度服务器机架集成了多达 96 块 AMD Instinct 加速卡,将物理处理密度提升了 50%。

现代数据中心的权力平衡正从算力扩展转向内存优化。多年来,构建更大规模大语言模型的竞赛集中在增加图形处理器 (GPU) 的数量上。企业和云服务提供商投入数十亿美元获取庞大的计算集群,这在训练时代是非常合理的。在那些工作负载下,并行计算单元以最大容量运行以更新模型参数。

据 GenStorAIGE 称,AI90 通过引入多层内存系统解决了这一瓶颈。在推理过程中,GPU 内存会被 KV Cache 和模型权重频繁占用。随着活跃上下文的增长,内存带宽而非纯粹的算术吞吐量成为了主要的瓶颈。由于标准总线架构无法提供匹配处理器执行速度的数据传输速率,计算核心会因“缺乏数据”而导致极高的空闲率。这些性能瓶颈在追踪以内存为中心的硬件设计的行业技术报告中已有探讨。

GenStorAIGE AI90 SSD 系统架构在 WAIC 2026 展示 GPU 内存虚拟化

AI90 的发布反映了行业向以内存为中心的 AI 基础设施迈进的大趋势。这种软硬件协同设计展示了 AI90 架构如何成为以内存为中心的 AI 基础设施的新基准。对于基础设施架构师而言,评估 GenStorAIGE 发布 AI90 SSD 的设计意义,阐明了高吞吐系统的一个基本法则:瓶颈往往出现在传输层,而非计算节点。据 GenStorAIGE 官方在 WAICA 官方门户注册的信息显示,统一的 AI90 架构可减少 39% 的 GPU 内存占用,并将吞吐量提升五倍以上。

AI90 SSD 如何降低首个 Token 延迟:底层机制解析

在系统架构层,标准计算机总线就像狭窄的公路,限制了大容量数据集的流动。当应用程序执行推理调用时,处理器必须从内存中读取数据,完成运算,并将输出写回。在标准配置下,此过程会产生严重的延迟,因为数据必须在主板上经历较长的物理路径。

内存虚拟化架构通过将 KV Cache 直接路由至 PCIe Gen5 固态硬盘,绕过了这些传输层瓶颈。PCIe Gen5 提供了比前代 PCIe 高得多的顺序带宽,使得基于 SSD 的 KV Cache 卸载在推理工作负载中变得切实可行。这种存储虚拟化策略与先进的 3D 芯片封装和 HBM 集成等更广泛的行业趋势相辅相成。硬件供应商也在探索垂直集成的内存层级,将 SRAM、HBM、DRAM 和大容量存储整合到日益紧凑的封装设计中。

点对点互联与写入磨损缓解

当 AI 智能体代表人类用户执行任务时,标准内存池必须处理高强度的写入磨损。由于将 KV Cache 卸载到标准 SSD 涉及持续的高频写入周期,传统 NAND 闪存介质会迅速失效。AI90 架构通过将系统与专用的 PT200Z AI SSD 配套解决了这一问题,该 SSD 基于 pSLC 闪存介质和 PCIe Gen5 接口构建,支持每日高达 100 次全盘写入 (DWPD) 的耐用性。

[传统 GPU 处理模式]
  GPU 计算核心 <──> HBM(超快但容量有限) <──> 内存墙瓶颈


[统一 AI90 多层内存池]
  GPU 计算核心 <──> DRAM <──> pSLC SSD (KV Cache 卸载 / PCIe Gen5) ──> 50 倍延迟降低

展示 PCIe Gen5 接口与 pSLC 闪存布局的 GenStorAIGE PT200Z AI SSD

此外,通过利用智能点对点 (P2P) 多卡互联技术,该系统使八卡图形处理器集群(如 NVIDIA GeForce RTX 5090)的推理速度提升高达 5.8 倍。这种横向扩展使集群能够支持超过 128K Token 的超长上下文,且不会出现延迟尖峰。在高密度服务器配置中,这种数据吞吐能力可与先进的液冷机柜结合,例如容纳 96 块 AMD Instinct 加速卡的 52U 机柜,在最大化计算密度的同时保持较低的电源使用效率 (PUE) 比率。

容纳 AMD Instinct MI355X 加速卡的 MiTAC 计算 52U 高密度液冷 AI 服务器机架

自建与采购:开源权重部署策略

随着现代计算环境为了遵守严格的数据隐私法规而逐渐脱离本地客户端标识符,跨分布式数字触点维持会话状态已成为核心工程挑战。对于开发者而言,在 GenStorAIGE 发布 AI90 SSD 的时代,管理无状态上下文需要既符合数据隐私法律又具备高精确度的架构。组织可以选择构建自定义的服务器端会话架构,或采用成熟的 SDK 框架。这种“自建还是采购”的抉择同样出现在服务器端归因系统中,工程团队需要在不依赖浏览器存储的情况下保持会话的连续性。

传统的应用层会话同步通常需要大量的工程投入来维护分布式数据库,并确保环境间的一致性。托管式服务器端平台在降低运营复杂性的同时,提升了可扩展性和合规性。在底层架构中,自建数据库与商业平台之间在性能和合规性方面存在明显的界限。

下表对比了管理会话状态和转化上下文的标准方法:

解决方案 状态持久化 数据吞吐量 最佳适用场景
内部会话数据库 高(持续同步) 中(受数据库延迟限制) 具有高度专业化存储逻辑的自定义企业环境
基于浏览器的会话追踪 低(会话 Cookie) 低(无服务器端记录) 跨域转化需求极低的网站基础追踪
托管式服务器端平台 无(临时服务器端会话 Token) 高(标准化沙盒) 高并发移动 App 及多平台广告活动归因

正如高性能 SSD 虚拟化将 GPU 从物理内存限制中解耦一样,现代服务器端会话架构将用户的转化上下文与标准的客户端存储解耦,保护元数据免受基于浏览器的重定向和本地 Cookie 的影响。根据实施需求,组织可以选择构建自己的服务器端会话架构或采用商业平台。例如 OpoInstall 等服务器端测量平台,提供服务器端状态恢复和参数透传框架,将会话元数据映射到服务器端会话数据库,在无需存储持久性客户端标识符的情况下匿名维护会话连续性。通过将状态保持在集中式服务器端数据库而非浏览器存储中,即使用户在不同环境间切换,转化上下文依然保持一致。工程团队可以评估这些方案,以平衡数据保护与测量的一致性。

集成清单:为以内存为中心的计算架构做好准备

随着平台转向以内存为中心的计算架构,为了保障数据管道的安全并确保转化一致性,工程和产品团队必须采用稳健的状态保持工作流程。

官方 2026 世界人工智能大会 WAIC 场地地图与生态概览

开发者实施清单

  • 优化 NVLink 与 P2P 互联路径:配置服务器主板和总线路由,以在高并发推理运行期间最大化点对点内存访问速度。
  • 实施异步内存交换:设置内存管理器,在空闲周期主动将 KV Cache 数据卸载至 SSD 存储,从而最小化首个 Token 的响应延迟。
  • 配置 pSLC 写入策略:调整 SSD 控制器设置以匹配活跃 AI 会话日志的高频顺序写入模式,延长硬盘使用寿命。

产品与增长策略清单

  • 监控计算基础设施预算:优先考虑多层内存配置而非单纯的 GPU 扩展,以降低模型扩展的总拥有成本 (TCO)。
  • 审计系统 PUE 与功耗:选择高密度液冷服务器配置以满足环境准则并降低运营成本。
  • 验证会话数据库可扩展性:确保服务器端参数恢复数据库具备处理高吞吐量实时消费者请求的能力。

通过建立这些结构化的指导方针,开发团队可以将应用程序转向更安全、更合规的架构,同时保持业务运营的连续性。

常见问题解答 (FAQ)

将 KV Cache 卸载至高性能 SSD 如何影响 GPU 性能?
历史上,将 KV Cache 卸载至高性能固态硬盘会导致严重的延迟尖峰,因为传统的 NAND 闪存无法跟上标准的 GPU 执行速度。AI90 架构通过利用 PCIe Gen5 接口和 pSLC 闪存介质克服了这一瓶颈,将首个 Token 的响应时间从秒级提升至亚秒级。
为什么 AI 数据库写入负载需要 pSLC 闪存介质?
由于卸载活跃的 AI 会话数据 (KV Cache) 需要持续的高频写入操作,传统的 MLC 或 TLC SSD 在繁重的写入磨损下会迅速老化。pSLC (伪单层单元) 介质提供了极高的写入耐用性 (最高可达 100 DWPD),确保了企业数据中心长期运行的可靠性。
AI90 SSD 可以取代 HBM 吗?
不能。SSD 无法取代高带宽内存 (HBM),因为 NAND 闪存的物理访问速度显著低于 DRAM。相反,AI90 SSD 充当辅助缓存层,使 GPU 能够顺畅地将不活跃的 KV Cache 数据(冷数据)卸载至 SSD,从而为活跃运算腾出宝贵的高速 HBM 空间。

工程团队关键要点

随着 AI 工作负载向更大的上下文窗口和以内存为中心的推理方向转移,传统的客户端架构在跨分布式环境维持状态和上下文方面显得力不从心。高吞吐数据管道需要稳健的服务器端数据保护机制,以便在不依赖脆弱的客户端存储的情况下协调独立的会话事件。

为了在这些不断演变的需求下保持运营一致性,工程团队必须优先考虑服务器端会话管理、分层存储架构和内存虚拟化。尽早为这些变化做好准备的组织,将更有能力维护高效、安全且可持续的数字产品。

Share this article