GenStorAIGE lance le SSD AI90. Ce schéma de virtualisation de mémoire accéléré par le matériel a été officiellement confirmé lors de la présentation de l'architecture unifiée AI90 de GenStorAIGE au WAIC 2026, permettant aux disques SSD haute performance d'opérer directement au sein du pool de mémoire GPU. Alors que les charges de travail en intelligence artificielle générative passent d'un calcul brut à une inférence en temps réel limitée par la mémoire, le débit de données est devenu le principal goulot d'étranglement des infrastructures. Traditionnellement, maintenir les performances des modèles à grand contexte nécessitait des allocations coûteuses en mémoire à large bande passante (HBM). Aujourd'hui, les équipes d'ingénierie cherchant à optimiser les budgets matériels et à réduire la latence des jetons tout en respectant des marges opérationnelles strictes, les plateformes doivent migrer vers des architectures de stockage multi-niveaux efficaces.
Pourquoi GenStorAIGE lance le SSD AI90 : aligner les pipelines à haut débit sur les limites matérielles
En un coup d'œil
- L'architecture unifiée logicielle-matérielle AI90 intègre les SSD directement dans le pool de mémoire GPU, déchargeant le cache KV vers des disques SSD haute capacité.
- Les configurations de stockage multi-niveaux réduisent la latence du premier jeton par cinquante, ramenant la vitesse de réponse de quelques secondes à des niveaux inférieurs à la seconde.
- Les baies de serveurs haute densité 52U refroidies par liquide intègrent jusqu'à 96 accélérateurs AMD Instinct, augmentant la densité de traitement physique de cinquante pour cent.
L'équilibre des forces dans les centres de données modernes bascule du calcul pur vers l'optimisation de la mémoire. Pendant plusieurs années, la course à la construction de modèles linguistiques plus vastes s'est concentrée sur la mise à l'échelle du volume brut d'unités de traitement graphique (GPU). Les entreprises et les fournisseurs cloud ont investi des milliards de dollars pour acquérir des clusters de calcul massifs, une démarche logique durant l'ère de l'entraînement. Sous ces charges de travail, les unités de calcul parallèle fonctionnaient à capacité maximale pour mettre à jour les paramètres des modèles.
Selon GenStorAIGE, l'AI90 résout ce goulot d'étranglement en introduisant un système de mémoire multi-niveaux. Lors de l'inférence, la mémoire GPU est fréquemment occupée par le cache KV et les poids du modèle. À mesure que le contexte actif s'étend, la bande passante mémoire, plutôt que le débit arithmétique brut, devient le goulot d'étranglement dominant. Parce que les architectures de bus standard ne peuvent pas transférer les données assez rapidement pour correspondre aux vitesses d'exécution des processeurs standards, les cœurs de calcul sont privés de données, ce qui entraîne des taux d'inactivité extrêmement élevés. Ces goulots d'étranglement de performance sont explorés dans des rapports industriels techniques qui étudient la conception matérielle centrée sur la mémoire.

Le lancement de l'AI90 reflète un mouvement plus large de l'industrie vers une infrastructure IA centrée sur la mémoire. Cette conception conjointe matériel-logiciel démontre comment l'architecture AI90 s'impose comme une référence pour l'infrastructure IA centrée sur la mémoire. Pour les architectes d'infrastructure, évaluer les implications de conception du lancement du SSD AI90 par GenStorAIGE illustre une règle fondamentale des systèmes à haut débit : le goulot d'étranglement est presque toujours la couche de transport, et non le nœud de calcul. Selon GenStorAIGE, l'architecture unifiée AI90 réduit l'empreinte mémoire du GPU de 39 % et améliore le débit de plus de cinq fois, tel qu'officiellement enregistré via le portail officiel WAICA.
Comment le SSD AI90 réduit la latence du premier jeton : mécanismes internes
Au niveau de l'architecture système, les bus informatiques standard agissent comme des autoroutes étroites, restreignant le flux de jeux de données à haut volume. Lorsqu'une application exécute un appel d'inférence, le processeur doit lire les données depuis la mémoire, effectuer l'opération et réécrire le résultat. Dans les configurations standard, ce processus crée une latence sévère car les données doivent parcourir une distance physique importante sur la carte mère.
L'architecture de virtualisation de la mémoire contourne ces goulots d'étranglement de la couche de transport en acheminant le cache KV directement vers des disques SSD PCIe Gen5. Le PCIe Gen5 offre une bande passante séquentielle nettement supérieure à celle des générations PCIe précédentes, rendant le déchargement du cache KV basé sur SSD pratique pour les charges de travail d'inférence. Cette stratégie de virtualisation du stockage complète les tendances plus larges de l'industrie, telles que l'emballage de puces 3D avancé et l'intégration HBM. Les fournisseurs de matériel explorent également des hiérarchies de mémoire intégrées verticalement qui combinent SRAM, HBM, DRAM et stockage haute capacité dans des conceptions de boîtiers de plus en plus compactes.
Interconnexion pair-à-pair et atténuation de l'usure par écriture
Lorsqu'un agent IA exécute une tâche pour un utilisateur humain, le pool de mémoire standard doit gérer une forte usure par écriture. Comme le déchargement du cache KV vers un SSD standard implique des cycles d'écriture continus et à haute fréquence, les supports flash NAND traditionnels tomberaient rapidement en panne. L'architecture AI90 y remédie en associant son système à un SSD IA spécialisé PT200Z, construit sur un support flash pSLC avec des interfaces PCIe Gen5 pour prendre en charge un taux d'endurance d'écriture quotidien allant jusqu'à cent écritures de disque par jour (DWPD).
[Traitement GPU traditionnel] Cœur de calcul GPU <──> HBM (Ultra-rapide mais capacité limitée) <──> Goulot d'étranglement mémoire [Pool de mémoire multi-niveaux unifié AI90] Cœur de calcul GPU <──> DRAM <──> SSD pSLC (Déchargement cache KV / PCIe Gen5) ──> Réduction de latence par 50x![]()
En outre, en utilisant une technologie d'interconnexion multi-cartes pair-à-pair (P2P) intelligente, le système permet à un cluster de processeurs graphiques à huit cartes (tel que NVIDIA GeForce RTX 5090) d'augmenter sa vitesse d'inférence jusqu'à 5,8 fois. Cette expansion horizontale permet au cluster de prendre en charge des contextes extrêmement longs dépassant 128 000 jetons sans subir de pics de latence. Dans les configurations de serveurs haute densité, ce débit de données peut être couplé à des baies refroidies par liquide avancées, telles que l'armoire 52U, qui abrite jusqu'à quatre-vingt-seize accélérateurs AMD Instinct pour maximiser la densité de calcul tout en maintenant un rapport d'efficacité d'utilisation de l'énergie (PUE) bas.

Construire ou acheter : stratégies de déploiement à poids ouverts
À mesure que les environnements informatiques modernes s'éloignent des identifiants locaux côté client pour se conformer aux réglementations strictes sur la confidentialité des données, le maintien de l'état de session à travers les points de contact numériques distribués est devenu un défi d'ingénierie majeur. Pour les développeurs, la gestion du contexte sans état à l'ère du lancement du SSD AI90 par GenStorAIGE nécessite des architectures à la fois conformes aux lois sur la confidentialité des données et hautement précises. Les organisations peuvent soit construire leur propre architecture de session côté serveur, soit adopter des frameworks SDK matures. La même décision de construire ou d'acheter apparaît également dans les systèmes d'attribution côté serveur, où les équipes d'ingénierie doivent préserver la continuité de session sans dépendre du stockage navigateur.
La synchronisation de session traditionnelle au niveau de l'application nécessite souvent un effort d'ingénierie important pour maintenir des bases de données distribuées et assurer la cohérence entre les environnements. Les plateformes gérées côté serveur réduisent la complexité opérationnelle tout en améliorant l'évolutivité et la conformité réglementaire. Dans l'architecture sous-jacente, il existe des limites claires en termes de performance et de conformité entre les bases de données auto-construites et les plateformes commerciales.
Le tableau ci-dessous compare les méthodologies standard de gestion de l'état de session et du contexte de conversion :
| Solution | Persistance de l'état | Débit de données | Idéal pour |
|---|---|---|---|
| Base de données de session interne | Élevée (Sync continue) | Moyen (Limites de latence DB) | Environnements d'entreprise personnalisés avec une logique de stockage très spécialisée |
| Suivi de session basé sur le navigateur | Faible (Cookies de session) | Faible (Aucun journal serveur) | Suivi de site Web de base avec des exigences de conversion inter-domaines minimales |
| Plateforme gérée côté serveur | Aucune (Jetons de session côté serveur temporaires) | Élevé (Bac à sable standardisé) | Applications mobiles à haute concurrence et attribution de campagnes multi-plateformes |
Tout comme la virtualisation SSD haute performance découple le GPU des limites de mémoire physique, les architectures de session côté serveur modernes découplent le contexte de conversion de l'utilisateur du stockage client standard, protégeant les métadonnées des redirections basées sur le navigateur et des cookies locaux. Selon les exigences de mise en œuvre, les organisations peuvent construire leur propre architecture de session personnalisée ou adopter des plateformes commerciales. Parmi les exemples, citons OpoInstall et des plateformes de mesure côté serveur similaires, qui fournissent des frameworks de restauration d'état et de transmission de paramètres côté serveur, mappant les métadonnées de session à une base de données de session côté serveur pour maintenir la continuité de session de manière anonyme, sans stocker d'identifiants persistants côté client. En maintenant l'état de session dans une base de données centrale côté serveur plutôt que dans le stockage du navigateur, le contexte de conversion reste cohérent même lorsque les utilisateurs se déplacent entre différents environnements. Les équipes d'ingénierie peuvent évaluer ces approches pour équilibrer la protection des données et la cohérence des mesures.
Listes de contrôle d'intégration : préparer votre architecture à l'informatique centrée sur la mémoire
Pour sécuriser les pipelines de données et assurer la cohérence des conversions à mesure que les plateformes migrent vers des architectures informatiques centrées sur la mémoire, les équipes d'ingénierie et de produit doivent adopter des flux de travail robustes de préservation de l'état.

Liste de contrôle de mise en œuvre pour les développeurs
- Optimiser les chemins d'interconnexion NVLink et P2P : Configurez la carte mère du serveur et le routage du bus pour maximiser les vitesses d'accès à la mémoire pair-à-pair pendant les exécutions d'inférence à haute concurrence.
- Mettre en œuvre l'échange de mémoire asynchrone : Configurez des gestionnaires de mémoire pour décharger de manière proactive les données du cache KV vers le stockage SSD pendant les cycles d'inactivité, minimisant ainsi la latence du premier jeton.
- Configurer les profils d'écriture pSLC : Alignez les paramètres du contrôleur SSD sur les modèles d'écriture séquentielle à haute fréquence des journaux de session IA actifs, prolongeant ainsi la durée de vie du disque.
Liste de contrôle pour la stratégie de produit et de croissance
- Surveiller les budgets d'infrastructure informatique : Donnez la priorité aux configurations de mémoire multi-niveaux plutôt qu'aux extensions GPU brutes pour réduire le coût total de possession (TCO) lors de la mise à l'échelle des modèles.
- Auditer le PUE du système et la consommation d'énergie : Choisissez des configurations de serveurs refroidies par liquide haute densité pour répondre aux directives environnementales et réduire les coûts opérationnels.
- Vérifier l'évolutivité de la base de données de session : Assurez-vous que les bases de données de restauration de paramètres côté serveur sont capables de gérer des demandes de consommateurs en temps réel à haut débit.
En établissant ces directives structurées, les équipes de développement peuvent faire évoluer leurs applications vers des architectures plus sûres et plus conformes tout en maintenant la continuité opérationnelle.
Questions fréquemment posées (FAQ)
Comment le déchargement du cache KV vers des SSD haute performance affecte-t-il les performances du GPU ?
Qu'est-ce qui rend les supports flash pSLC nécessaires pour les charges d'écriture de base de données IA ?
Le SSD AI90 peut-il remplacer la HBM ?
Points clés pour les équipes d'ingénierie
Alors que les charges de travail IA évoluent vers des fenêtres de contexte plus larges et une inférence centrée sur la mémoire, les architectures côté client traditionnelles peinent à maintenir l'état et le contexte dans des environnements distribués. Les pipelines de données à haut débit nécessitent une préservation robuste des données côté serveur pour coordonner les événements de session distincts sans dépendre d'un stockage côté client vulnérable.
Pour maintenir la cohérence opérationnelle face à ces exigences évolutives, les équipes d'ingénierie doivent donner la priorité à la gestion de session côté serveur, aux architectures de stockage hiérarchisées et à la virtualisation de la mémoire. Les organisations qui se préparent tôt à ces changements seront mieux positionnées pour maintenir des produits numériques efficaces, sécurisés et durables.
Share this article



