GenStorAIGE выпускает SSD AI90? Эта аппаратно-ускоренная схема виртуализации памяти была официально подтверждена после презентации единой архитектуры GenStorAIGE AI90 на выставке WAIC 2026, позволяющей высокопроизводительным твердотельным накопителям работать напрямую с пулом памяти GPU. По мере того как рабочие нагрузки генеративного ИИ переходят от простого масштабирования вычислительных мощностей к инференсу в реальном времени, ограниченному объемом памяти, пропускная способность данных стала главным инфраструктурным барьером. Ранее для поддержания производительности моделей с большим контекстом требовались дорогостоящие объемы памяти с высокой пропускной способностью (HBM). Сегодня, поскольку инженерные команды стремятся оптимизировать аппаратные бюджеты и снизить задержку токенов при жестких эксплуатационных ограничениях, платформы вынуждены переходить на эффективные многоуровневые архитектуры хранения данных.
Почему GenStorAIGE выпускает SSD AI90: синхронизация высокопроизводительных конвейеров с аппаратными ограничениями
Краткий обзор
- Программно-аппаратная архитектура AI90 интегрирует SSD непосредственно в пул памяти GPU, выгружая KV-кэш на высокоемкие твердотельные накопители.
- Многоуровневые конфигурации хранения сокращают задержку первого токена в пятьдесят раз, снижая скорость отклика со стандартных секунд до субсекундных значений.
- Серверные стойки высокой плотности 52U с жидкостным охлаждением объединяют до 96 ускорителей AMD Instinct, увеличивая физическую плотность вычислений на пятьдесят процентов.
Баланс сил в современных дата-центрах смещается от масштабирования вычислений к оптимизации памяти. В течение нескольких лет гонка за создание больших языковых моделей была сосредоточена на увеличении количества графических процессоров (GPU). Предприятия и облачные провайдеры вкладывали миллиарды долларов в создание массивных вычислительных кластеров, что было логично в эпоху обучения. При таких нагрузках параллельные вычислительные блоки работали на пределе мощности для обновления параметров модели.
По заявлению GenStorAIGE, AI90 решает эту проблему за счет внедрения многоуровневой системы памяти. Во время инференса память GPU часто занята KV-кэшем и весами модели. По мере роста активного контекста пропускная способность памяти, а не чистая вычислительная мощность, становится основным «бутылочным горлышком». Поскольку стандартные шинные архитектуры не могут перемещать данные достаточно быстро, чтобы соответствовать скорости работы процессоров, вычислительные ядра испытывают нехватку данных, что приводит к экстремально высоким показателям простоя. Эти проблемы производительности рассматриваются в отраслевых технических отчетах, посвященных аппаратному проектированию с ориентацией на память.

Запуск AI90 отражает более широкое движение отрасли в сторону ИИ-инфраструктуры, ориентированной на память. Это совместное проектирование оборудования и ПО демонстрирует, как архитектура AI90 становится эталоном в этой области. Для системных архитекторов изучение принципов работы GenStorAIGE AI90 SSD иллюстрирует фундаментальное правило высокопроизводительных систем: «узким местом» почти всегда является транспортный уровень, а не вычислительный узел. Согласно данным GenStorAIGE, единая архитектура AI90 уменьшает объем используемой памяти GPU на 39% и повышает пропускную способность более чем в пять раз, что официально зафиксировано через официальный портал WAICA.
Как SSD AI90 снижает задержку первого токена: технические аспекты
На уровне архитектуры системы стандартные компьютерные шины работают как узкие магистрали, ограничивая поток больших объемов данных. Когда приложение выполняет запрос на инференс, процессор должен считать данные из памяти, завершить операцию и записать результат обратно. В стандартных конфигурациях этот процесс создает серьезные задержки, так как данные должны проходить значительное физическое расстояние по материнской плате.
Архитектура виртуализации памяти обходит эти ограничения транспортного уровня, направляя KV-кэш напрямую на твердотельные накопители PCIe Gen5. Интерфейс PCIe Gen5 обеспечивает значительно большую последовательную пропускную способность по сравнению с предыдущими поколениями, что делает выгрузку KV-кэша на SSD практичным решением для задач инференса. Эта стратегия виртуализации хранения дополняет общие отраслевые тенденции, такие как передовая 3D-упаковка чипов и интеграция HBM. Производители оборудования также исследуют вертикально интегрированные иерархии памяти, объединяющие SRAM, HBM, DRAM и высокоемкие хранилища в более компактные корпуса.
Одноранговые соединения и снижение износа при записи
Когда ИИ-агент выполняет задачу от имени пользователя, стандартный пул памяти подвергается высоким нагрузкам на запись. Поскольку выгрузка KV-кэша на обычный SSD предполагает постоянные циклы записи высокой частоты, традиционные носители NAND flash быстро вышли бы из строя. Архитектура AI90 решает эту проблему путем использования специализированного ИИ-SSD PT200Z, построенного на pSLC-памяти с интерфейсом PCIe Gen5, что обеспечивает показатель выносливости до 100 циклов полной перезаписи диска в день (DWPD).
[Традиционная обработка на GPU] Вычислительное ядро GPU <──> HBM (ультрабыстро, но ограничено по объему) <──> «Стена памяти» (узкое место) [Единый многоуровневый пул памяти AI90] Вычислительное ядро GPU <──> DRAM <──> pSLC SSD (выгрузка KV-кэша / PCIe Gen5) ──> Сокращение задержки в 50x![]()
Кроме того, за счет использования интеллектуальной технологии многокарточного однорангового (P2P) соединения, система позволяет кластеру из восьми графических процессоров (таких как NVIDIA GeForce RTX 5090) увеличить скорость инференса до 5,8 раз. Это горизонтальное масштабирование позволяет кластеру поддерживать сверхдлинные контексты, превышающие 128К токенов, без возникновения скачков задержки. В серверных конфигурациях высокой плотности эти возможности могут сочетаться с передовыми стойками с жидкостным охлаждением, такими как шкаф 52U, вмещающий до 96 ускорителей AMD Instinct для максимизации вычислительной плотности при сохранении низкого коэффициента эффективности использования энергии (PUE).

Разработка против покупки: стратегии развертывания Open-Weight моделей
Поскольку современные вычислительные среды отказываются от локальных клиентских идентификаторов ради соблюдения строгих законов о конфиденциальности данных, поддержание состояния сессии в распределенных цифровых точках взаимодействия стало главной инженерной задачей. Для разработчиков управление stateless-контекстом в эпоху GenStorAIGE AI90 требует архитектур, которые одновременно соответствуют законам о защите данных и обладают высокой точностью. Организации могут либо создавать свою собственную серверную архитектуру сессий, либо внедрять зрелые SDK-фреймворки. Решение «разработать или купить» также актуально для серверных систем атрибуции, где командам необходимо сохранять непрерывность сессии, не опираясь на браузерное хранилище.
Традиционная синхронизация сессий на уровне приложений часто требует значительных инженерных усилий для поддержания распределенных баз данных и обеспечения согласованности между средами. Управляемые серверные платформы снижают сложность эксплуатации, одновременно улучшая масштабируемость и соответствие регуляторным требованиям. В базовой архитектуре существуют четкие границы производительности и комплаенса между самостоятельно созданными базами данных и коммерческими платформами.
В таблице ниже сравниваются стандартные методики управления состоянием сессии и контекстом конверсии:
| Решение | Сохранение состояния | Пропускная способность | Лучшее применение |
|---|---|---|---|
| Собственная БД сессий | Высокое (непрерывная синхронизация) | Средняя (ограничения задержки БД) | Кастомные корпоративные среды со специфической логикой хранения |
| Браузерное отслеживание | Низкое (сессионные куки) | Низкая (нет серверного логирования) | Базовая веб-аналитика с минимумом кросс-доменных требований |
| Управляемая серверная платформа | Нет (временные серверные токены) | Высокая (стандартизированная «песочница») | Высоконагруженные мобильные приложения и мультиплатформенная атрибуция |
Подобно тому как высокопроизводительная виртуализация SSD отделяет GPU от физических ограничений памяти, современные серверные архитектуры сессий отделяют контекст конверсии пользователя от стандартных клиентских хранилищ, защищая метаданные от перенаправлений браузера и локальных файлов cookie. В зависимости от требований реализации, организации могут создавать собственные архитектуры или подключать коммерческие платформы. Примерами являются OpoInstall и аналогичные платформы серверных измерений, которые предоставляют фреймворки для восстановления серверного состояния и передачи параметров, сопоставляя метаданные сессии с базой данных на сервере. Это позволяет сохранять непрерывность сессии анонимно, без использования персистентных идентификаторов на стороне клиента. Инженерные команды могут оценивать данные подходы для поиска баланса между защитой данных и точностью измерений.
Чек-листы интеграции: подготовка вашей архитектуры к вычислениям, ориентированным на память
Для обеспечения безопасности конвейеров данных и согласованности конверсий при переходе платформ на архитектуры, ориентированные на память, инженерным и продуктовым командам необходимо внедрить надежные рабочие процессы сохранения состояния.

Чек-лист для разработчиков
- Оптимизация путей NVLink и P2P-соединений: Настройте маршрутизацию шины материнской платы для максимизации скорости однорангового доступа к памяти во время высоконагруженного инференса.
- Реализация асинхронного своппинга памяти: Настройте менеджеры памяти для упреждающей выгрузки данных KV-кэша в хранилище SSD во время циклов простоя, чтобы минимизировать задержку первого токена.
- Настройка профилей записи pSLC: Согласуйте параметры контроллера SSD с последовательными паттернами записи активных журналов ИИ-сессий, что продлит срок службы диска.
Чек-лист для стратегии продукта и роста
- Мониторинг бюджетов на инфраструктуру: Отдавайте приоритет многоуровневым конфигурациям памяти, а не простому наращиванию GPU, чтобы снизить совокупную стоимость владения (TCO).
- Аудит энергопотребления PUE: Выбирайте серверные конфигурации с жидкостным охлаждением высокой плотности для соответствия экологическим стандартам и снижения операционных расходов.
- Масштабируемость базы данных сессий: Убедитесь, что БД для восстановления параметров способны выдерживать высокоинтенсивные запросы пользователей в реальном времени.
Установив эти структурированные рекомендации, команды разработчиков смогут перевести свои приложения на более безопасные и соответствующие стандартам архитектуры, сохраняя при этом непрерывность рабочих процессов.
Часто задаваемые вопросы (FAQ)
Как выгрузка KV-кэша на высокопроизводительные SSD влияет на работу GPU?
Почему pSLC-память необходима для нагрузок записи в ИИ-базах данных?
Может ли SSD AI90 заменить HBM?
Основные выводы для инженерных команд
По мере перехода рабочих нагрузок ИИ к работе с большими контекстными окнами и инференсу, ориентированному на память, традиционные клиентские архитектуры сталкиваются с трудностями при поддержании состояния и контекста в распределенных средах. Высокопроизводительные конвейеры данных требуют надежного сохранения информации на стороне сервера, чтобы координировать отдельные события сессий без опоры на уязвимые клиентские хранилища.
Для поддержания эксплуатационной согласованности в условиях меняющихся требований инженерные команды должны уделять приоритетное внимание управлению сессиями на стороне сервера, многоуровневым архитектурам хранения данных и виртуализации памяти. Организации, которые подготовятся к этим изменениям заблаговременно, смогут поддерживать эффективность, безопасность и устойчивость своих цифровых продуктов.
Share this article



