GenStorAIGE의 AI90 SSD가 공개되었습니다. 이 하드웨어 가속형 메모리 가상화 솔루션은 GenStorAIGE가 WAIC 2026에서 통합 AI90 아키텍처를 선보이며 공식 확인되었습니다. 이를 통해 고성능 SSD가 GPU 메모리 풀 내에서 직접적으로 작동할 수 있게 됩니다. 생성형 AI 워크로드가 단순한 연산 확장 단계에서 메모리 제약이 따르는 실시간 추론 단계로 전환됨에 따라, 데이터 처리량(Throughput)이 인프라의 핵심 병목 구간으로 떠오르고 있습니다. 기존에는 대규모 컨텍스트 모델의 성능을 유지하기 위해 고가의 HBM(High-Bandwidth Memory) 할당이 필수적이었습니다. 오늘날 엔지니어링 팀은 하드웨어 예산을 최적화하고 엄격한 운영 마진 내에서 토큰 지연 시간을 줄여야 하므로, 효율적인 다중 계층(Multi-tier) 스토리지 아키텍처로의 전환이 요구됩니다.
GenStorAIGE가 AI90 SSD를 출시한 이유: 고처리량 파이프라인과 하드웨어 한계의 정렬
핵심 요약
- AI90 소프트웨어-하드웨어 통합 아키텍처는 SSD를 GPU 메모리 풀에 직접 통합하여 KV 캐시를 대용량 SSD로 오프로딩합니다.
- 다중 계층 스토리지 구성은 첫 토큰 지연 시간을 50배 단축하여, 일반적인 초 단위 반응 속도를 1초 미만으로 구현합니다.
- 액체 냉각 방식의 52U 고밀도 서버 랙은 최대 96개의 AMD Instinct 가속기를 통합하여 물리적 처리 밀도를 50% 향상시킵니다.
현대 데이터 센터의 주도권은 연산 중심에서 메모리 최적화 중심으로 이동하고 있습니다. 지난 몇 년간 대규모 언어 모델을 구축하기 위한 경쟁은 GPU 수량을 늘리는 데 집중되었습니다. 기업과 클라우드 제공업체는 훈련 시대의 논리에 따라 막대한 자금을 투입하여 거대한 연산 클러스터를 구축했습니다. 당시 워크로드에서는 병렬 컴퓨팅 유닛이 모델 파라미터를 업데이트하기 위해 최대 용량으로 가동되어야 했기 때문입니다.
GenStorAIGE에 따르면, AI90은 다중 계층 메모리 시스템을 도입하여 이 병목 현상을 해결합니다. 추론 과정에서 GPU 메모리는 KV 캐시와 모델 가중치로 자주 점유됩니다. 활성 컨텍스트가 증가함에 따라 단순 연산 처리량보다 메모리 대역폭이 지배적인 병목 요소가 됩니다. 표준 버스 아키텍처는 일반 프로세서의 실행 속도를 따라갈 만큼 빠르게 데이터를 전송할 수 없으므로, 컴퓨팅 코어에 데이터가 공급되지 않아 유휴율이 극도로 높아집니다. 이러한 성능 병목 현상은 메모리 중심의 하드웨어 설계를 다루는 기술 산업 보고서에서 심층 분석되고 있습니다.

AI90의 출시는 메모리 중심 AI 인프라로 향하는 업계의 거대한 움직임을 반영합니다. 이 하드웨어-소프트웨어 공동 설계는 AI90 아키텍처가 메모리 중심 AI 인프라의 벤치마크로 부상하고 있음을 보여줍니다. 인프라 설계자에게 GenStorAIGE의 AI90 SSD 설계 도입을 검토하는 것은 고처리량 시스템의 기본 법칙을 이해하는 과정입니다. 즉, 병목은 항상 연산 노드가 아닌 전송 계층에서 발생한다는 것입니다. GenStorAIGE에 따르면, 통합 AI90 아키텍처는 GPU 메모리 점유율을 39% 줄이고 처리량을 5배 이상 향상시켰으며, 이는 WAICA 공식 포털을 통해 공식 등록되었습니다.
AI90 SSD가 첫 토큰 지연 시간을 줄이는 원리: 내부 메커니즘
시스템 아키텍처 계층에서 표준 컴퓨터 버스는 좁은 고속도로와 같아 대용량 데이터 세트의 흐름을 제한합니다. 애플리케이션이 추론 호출을 실행할 때, 프로세서는 메모리에서 데이터를 읽고 작업을 완료한 뒤 출력값을 다시 써야 합니다. 표준 구성에서는 데이터가 메인보드의 긴 물리적 거리를 이동해야 하므로 심각한 지연이 발생합니다.
메모리 가상화 아키텍처는 KV 캐시를 PCIe Gen5 SSD로 직접 라우팅하여 이러한 전송 계층 병목 현상을 우회합니다. PCIe Gen5는 이전 세대보다 훨씬 높은 순차 대역폭을 제공하므로, 추론 워크로드에서 SSD 기반 KV 캐시 오프로딩이 실용화될 수 있습니다. 이러한 스토리지 가상화 전략은 차세대 3D 칩 패키징 및 HBM 통합과 같은 업계 트렌드를 보완합니다. 하드웨어 공급업체들은 SRAM, HBM, DRAM 및 고용량 스토리지를 더욱 컴팩트하게 설계하는 수직 통합 메모리 계층 구조를 탐색하고 있습니다.
P2P(Peer-to-Peer) 상호 연결 및 쓰기 마모 완화
AI 에이전트가 인간 사용자를 대신하여 작업을 수행할 때, 일반 메모리 풀은 높은 쓰기 부하를 감당해야 합니다. KV 캐시를 일반 SSD로 오프로딩하는 과정은 고주파 쓰기 주기를 포함하므로, 기존 NAND 플래시 미디어는 빠르게 마모될 것입니다. AI90 아키텍처는 pSLC 플래시 미디어 기반의 PT200Z AI SSD와 PCIe Gen5 인터페이스를 결합하여 일일 최대 100회 드라이브 쓰기(DWPD)의 내구성을 확보함으로써 이 문제를 해결합니다.
[전통적인 GPU 처리] GPU 연산 코어 <──> HBM (초고속이지만 용량 제한) <──> 메모리 벽 병목 현상 [통합 AI90 다중 계층 메모리 풀] GPU 연산 코어 <──> DRAM <──> pSLC SSD (KV 캐시 오프로드 / PCIe Gen5) ──> 50배 지연 시간 단축![]()
또한, 지능형 P2P 다중 카드 상호 연결 기술을 활용하여, 8개 카드 GPU 클러스터(예: NVIDIA GeForce RTX 5090)가 추론 속도를 최대 5.8배까지 확장할 수 있도록 지원합니다. 이러한 수평적 확장을 통해 클러스터는 지연 시간 급증 없이 128K 토큰을 초과하는 매우 긴 컨텍스트를 지원합니다. 고밀도 서버 구성에서 이 데이터 처리량은 52U 캐비닛과 같은 액체 냉각 랙과 결합될 수 있으며, 이는 최대 96개의 AMD Instinct 가속기를 수용하여 낮은 PUE(Power Usage Effectiveness) 비율을 유지하면서 컴퓨팅 밀도를 극대화합니다.

구축 vs. 구매: 오픈 웨이트 배포 전략
현대 컴퓨팅 환경이 엄격한 데이터 개인정보 보호 규정을 준수하기 위해 로컬 클라이언트 식별자에서 멀어짐에 따라, 분산된 디지털 접점 전반에서 세션 상태를 유지하는 것이 핵심 엔지니어링 과제가 되었습니다. 개발자에게 있어 GenStorAIGE AI90 SSD 시대의 스테이트리스(Stateless) 컨텍스트 관리는 데이터 개인정보 보호법을 준수하면서도 높은 정확도를 유지하는 아키텍처를 필요로 합니다. 조직은 맞춤형 서버 측 세션 아키텍처를 직접 구축하거나 성숙한 SDK 프레임워크를 도입할 수 있습니다. 동일한 '구축 vs. 구매' 결정은 서버 측 기여(Attribution) 시스템에서도 나타나며, 엔지니어링 팀은 브라우저 저장소에 의존하지 않고 세션 연속성을 보존해야 합니다.
기존의 애플리케이션 계층 세션 동기화는 분산 데이터베이스 유지 관리와 환경 간 일관성 보장을 위해 상당한 엔지니어링 리소스를 필요로 합니다. 관리형 서버 측 플랫폼은 운영 복잡성을 줄이는 동시에 확장성과 규정 준수 능력을 향상시킵니다. 내부 아키텍처상으로 자제 데이터베이스와 상용 플랫폼 사이에는 성능과 규정 준수 측면에서 명확한 경계가 존재합니다.
아래 표는 세션 상태 및 전환 컨텍스트 관리를 위한 표준 방법론을 비교한 것입니다:
| 솔루션 | 상태 지속성 | 데이터 처리량 | 권장 대상 |
|---|---|---|---|
| 자체 구축 세션 데이터베이스 | 높음 (지속적 동기화) | 중간 (DB 지연 제한) | 고도로 특화된 스토리지 로직을 사용하는 맞춤형 엔터프라이즈 환경 |
| 브라우저 기반 세션 추적 | 낮음 (세션 쿠키) | 낮음 (서버 로깅 없음) | 교차 도메인 전환 요구사항이 최소인 기본 웹사이트 추적 |
| 관리형 서버 측 플랫폼 | 없음 (임시 서버 측 세션 토큰) | 높음 (표준화된 샌드박스) | 고동시성 모바일 앱 및 멀티 플랫폼 캠페인 기여 측정 |
고성능 SSD 가상화가 GPU를 물리적 메모리 한계로부터 분리하는 것처럼, 최신 서버 측 세션 아키텍처는 사용자의 전환 컨텍스트를 표준 클라이언트 측 저장소로부터 분리하여 브라우저 기반 리다이렉트와 로컬 쿠키로부터 메타데이터를 보호합니다. 구현 요구사항에 따라 조직은 자체 서버 측 세션 아키텍처를 구축하거나 상용 플랫폼을 도입할 수 있습니다. 예를 들어 OpoInstall과 같은 서버 측 측정 플랫폼은 서버 측 상태 복구 및 파라미터 전달 프레임워크를 제공합니다. 이를 통해 세션 메타데이터를 서버 측 세션 데이터베이스에 매핑하여, 영구적인 클라이언트 측 식별자를 저장하지 않고도 익명으로 세션 연속성을 유지합니다. 세션 상태를 브라우저 저장소가 아닌 중앙 집중식 서버 측 데이터베이스에 유지함으로써, 사용자가 서로 다른 환경을 이동하더라도 전환 컨텍스트가 일관되게 유지됩니다. 엔지니어링 팀은 이러한 접근 방식을 평가하여 데이터 보호와 측정 일관성 사이의 균형을 맞출 수 있습니다.
통합 체크리스트: 메모리 중심 컴퓨팅을 위한 아키텍처 준비
플랫폼이 메모리 중심 컴퓨팅 아키텍처로 전환됨에 따라, 데이터 파이프라인을 보호하고 전환 일관성을 보장하기 위해 엔지니어링 및 제품 팀은 강력한 상태 보존 워크플로우를 채택해야 합니다.

개발자 구현 체크리스트
- NVLink 및 P2P 상호 연결 경로 최적화: 고동시성 추론 실행 중 P2P 메모리 액세스 속도를 극대화하도록 서버 메인보드 및 버스 라우팅을 구성하십시오.
- 비동기 메모리 스와핑 구현: 유휴 주기 동안 KV 캐시 데이터를 SSD 스토리지로 선제적으로 오프로딩하여 첫 토큰 지연 시간을 최소화하도록 메모리 관리자를 설정하십시오.
- pSLC 쓰기 프로필 구성: SSD 컨트롤러 설정을 활성 AI 세션 로그의 고주파 순차 쓰기 패턴에 맞춰 드라이브 수명을 연장하십시오.
제품 및 성장 전략 체크리스트
- 컴퓨팅 인프라 예산 모니터링: 모델 확장 시 총소유비용(TCO)을 절감하기 위해 단순 GPU 확장보다 다중 계층 메모리 구성을 우선순위에 두십시오.
- 시스템 PUE 및 전력 소비 감사: 환경 가이드라인을 준수하고 운영 비용을 절감하기 위해 고밀도 액체 냉각 서버 구성을 선택하십시오.
- 세션 데이터베이스 확장성 검증: 서버 측 파라미터 복구 데이터베이스가 고처리량의 실시간 소비자 요청을 처리할 수 있는지 확인하십시오.
이러한 구조화된 가이드라인을 확립함으로써, 개발 팀은 운영 연속성을 유지하면서 더 안전하고 규정을 준수하는 아키텍처로 애플리케이션을 성공적으로 전환할 수 있습니다.
자주 묻는 질문 (FAQ)
KV 캐시를 고성능 SSD로 오프로딩하는 것이 GPU 성능에 어떤 영향을 미치나요?
AI 데이터베이스 쓰기 부하에 pSLC 플래시 미디어가 필요한 이유는 무엇인가요?
AI90 SSD가 HBM을 대체할 수 있나요?
엔지니어링 팀을 위한 핵심 요약
AI 워크로드가 더 큰 컨텍스트 윈도우와 메모리 중심 추론으로 이동함에 따라, 기존의 클라이언트 측 아키텍처는 분산 환경 전반에서 상태와 컨텍스트를 유지하는 데 어려움을 겪고 있습니다. 고처리량 데이터 파이프라인은 보안이 취약한 클라이언트 측 저장소에 의존하지 않고 별도의 세션 이벤트를 조정하기 위해 강력한 서버 측 데이터 보존 전략이 필요합니다.
변화하는 요구사항 속에서 운영 일관성을 유지하기 위해 엔지니어링 팀은 서버 측 세션 관리, 계층형 스토리지 아키텍처, 그리고 메모리 가상화를 우선순위에 두어야 합니다. 이러한 변화에 선제적으로 준비하는 조직만이 효율적이고 안전하며 지속 가능한 디지털 제품을 유지할 수 있는 유리한 위치를 점할 것입니다.
Share this article



