NVIDIA가 Rubin NVL72를 출시했습니다. 새로운 온실리콘 성능 데이터에 따르면 Vera Rubin NVL72 플랫폼은 테스트된 AgentX 구성에서 GB300 NVL72 대비 메가와트당 최대 30배 높은 처리량과 35배 낮은 토큰 비용을 제공하여 전력이 제한된 AI 팩토리를 위한 새로운 하드웨어 효율성 기준을 세웠습니다. 자율 소프트웨어 에이전트가 실험적인 단일 턴 프롬프트에서 다단계 프로덕션 파이프라인으로 전환됨에 따라 연산 수요가 급격히 증가하고 있습니다. NVIDIA가 인용한 OpenRouter 사용 데이터에 따르면, 단일 에이전틱 요청은 에이전트가 반복적으로 데이터베이스를 쿼리하고, 외부 문서를 검색하며, 서브 에이전트를 생성하고, 긴 컨텍스트 메모리를 유지하기 때문에 일반 채팅 요청보다 약 15배 많은 토큰을 소모합니다. 고정된 데이터 센터 전력 제약 내에서 이러한 고밀도 처리량을 유지하기 위해 서버 아키텍처는 극단적인 하드웨어-소프트웨어 공동 설계로 전환되고 있습니다.
핵심 산업 재편 및 뉴스 분석: 에이전틱 AI 규모 확장을 위한 Vera Rubin NVL72
요약
- 2026년 8월 24일에 공개된 온실리콘 성능 데이터에 따르면 Vera Rubin NVL72는 에이전틱 코딩 워크로드에서 GB300 NVL72보다 메가와트당 최대 30배 높은 처리량을 제공하며, 해당 결과는 NVIDIA가 SemiAnalysis AgentX 워크로드를 사용하여 측정했고 현재 SemiAnalysis 검토가 진행 중입니다.
- 다단계 자율 에이전트는 표준 챗봇 상호작용보다 대략 15배 더 많은 토큰을 소모하므로 전력 가용성, 메가와트당 처리량 및 토큰 경제성은 AI 인프라에서 점점 더 중요한 제약 조건이 되고 있습니다.
- 이 플랫폼은 분리형 서빙, 분산 KV 캐싱, KV 인식 라우팅, NVFP4 정밀도, 랙 규모 네트워킹 및 광범위한 하드웨어-소프트웨어 공동 Design을 결합하여 테스트된 AgentX 구성에서 GB300 NVL72 대비 최대 35배의 토큰 비용 절감을 달성했습니다.
기본 챗봇 인터페이스에서 자율 에이전틱 워크플로로의 전환은 데이터 센터 엔지니어링의 구조적 변화를 주도하고 있습니다. 표준 단일 턴 상호작용은 일반적으로 1,000토큰에서 8,000토큰 사이의 간결한 입력-출력 경계 내에서 작동합니다. 대조적으로 자율 에이전트는 모든 도구 호출, 데이터베이스 검색 및 중간 출력이 후속 단계의 컨텍스트 윈도우에 누적되는 반복적인 추론 루프를 실행합니다. 이러한 복합적인 컨텍스트는 연산의 불규칙한 버스트와 네트워크 지연 기간을 생성하여 정적 프롬프트 및 응답 워크로드용으로 설계된 기존 추론 서버에 부담을 줍니다.
이러한 현실적인 조건에서 인프라 성능을 평가하기 위해 하드웨어 벤치마크는 고정 길이 시퀀스 평가에서 동적 세션 리플레이로 이동하고 있습니다. SemiAnalysis AgentX 벤치마크 스위트를 사용하여 NVIDIA는 DeepSeek V4 Pro, Kimi K3, GLM-5.3을 포함한 주요 모델의 리플레이된 프로덕션 스타일 코딩 궤적 전반에서 지속되는 시스템 처리량을 측정했습니다. 기록된 세션은 하드웨어가 원시 전력을 유용한 출력으로 얼마나 효율적으로 변환하는지 테스트하기 위해 현실적인 컨텍스트 증가, 도구 호출 간격 및 서브 에이전트 생성 패턴을 유지하며, 이는 NVIDIA 기업 기술 발표에 자세히 설명되어 있습니다. Vera Rubin 결과는 이러한 초기 측정을 반영하며 현재 SemiAnalysis 검토를 기다리고 있습니다.

Vera Rubin 플랫폼 전반에서 측정된 효율성 도약은 가속 컴퓨팅 플랫폼이 평가되는 방식의 주요 변화를 보여줍니다. 전력이 제한된 AI 팩토리에서 메가와트당 처리량은 총 운영 용량을 결정하는 반면, 백만 토큰당 비용은 매출총이익을 좌우합니다. 벤치마크 결과에 따르면 Blackwell GB300 NVL72는 Hopper H200 시스템에 비해 메가와트당 최대 15배 더 높은 처리량과 10배 더 낮은 토큰 비용을 제공합니다. NVIDIA 개발자 블로그 보고서에 보고된 바와 같이, Vera Rubin 아키텍처는 이 효율성 곡선을 더욱 확장하여 DeepSeek V4 Pro 워크로드에서 사용자당 초당 160토큰의 대화형 서빙 목표에서 GB300보다 메가와트당 최대 30배 더 높은 처리량을 달성합니다.

내부 아키텍처 분리: 분리형 서빙과 KV 캐시 라우팅
Rubin 아키텍처의 성능 향상은 대규모 언어 모델 추론의 프리필(prefill) 단계와 디코드(decode) 단계 간의 근본적인 물리적 불일치를 해결하는 데서 비롯됩니다. 프리필 단계는 수신된 프롬프트를 처리하며 연산 집약적이어서 높은 병렬 산술 처리량의 이점을 얻습니다. 대조적으로 디코드 단계는 토큰을 순차적으로 생성하며, 토큰 생성이 모델 가중치와 KV 상태에 반복적으로 접근하기 때문에 특히 더 작은 대화형 배치 크기에서 일반적으로 메모리 대역폭에 더 민감합니다.
이러한 운영상의 마찰을 없애기 위해 현대 AI 팩토리 아키텍처는 분리형 서빙을 구현합니다. 이 기술은 독립적으로 확장되는 작업자 풀 간에 프리필 및 디코드 실행을 분리하여 각 단계가 독립적으로 확장되고 서버 클러스터 전반에서 생성율을 동적으로 일치시킬 수 있도록 합니다.
메모리 최적화: 분산 캐싱과 NVLink 스케일 업 도메인
장기 실행 에이전틱 세션에서는 이전에 처리된 토큰을 다시 연산하면 막대한 연산 중복이 발생합니다. 효율성을 유지하기 위해 서빙 프레임워크는 고속 상호 연결 도메인 전반에 걸쳐 분산 키-값(KV) 캐싱을 배포하여 GPU가 중복 프리필 계산 없이 컨텍스트를 공유하고 재사용할 수 있도록 합니다.
아래 다이어그램은 분리형 프리필 처리와 KV 인식 디코드 생성 간의 아키텍처 분리를 보여줍니다.
[Incoming Multi-Step Agent Request (Cumulative Context)]
│
▼
[ Disaggregated Prefill Worker Pool ] ──> Accelerated Context Encoding
│
▼ (Context State Transfer via High-Bandwidth Fabric)
[ KV-Aware Routing Dispatcher (Dynamo) ] ──> Matches Cached Worker Node
│
▼
[ Disaggregated Decode Worker Pool ] ──> Low-Latency Token Generation
이러한 분산 메모리 기술을 지원하기 위해 이 시스템은 기성 네트워킹보다 실질적으로 더 높은 패킷 레이트와 더 낮은 지연 시간을 제공하는 6세대 상호 연결 스위칭을 활용합니다. 최적화된 CUDA 커널, TensorRT-LLM과 같은 런타임 라이브러리, NVIDIA Dynamo와 같은 조정 프레임워크에 걸쳐 서빙 계층은 관련 캐시된 컨텍스트를 이미 보유하고 있는 실행 노드로 요청을 직접 라우팅합니다. NVIDIA는 DSX MaxLPS 전력 관리 기술이 동일한 메가와트 예산 내에서 최대 40% 더 많은 GPU를 프로비저닝할 수 있으며, 유틸리티 규모에서 처리량을 더욱 극대화한다고 밝혔습니다.

이 풀스택 접근 방식은 더 넓은 기술적 원칙을 보여줍니다. 현대 AI 워크로드를 확장하려면 시스템의 모든 계층에서 중복 연산을 제거하고 메모리 전송을 최적화해야 합니다. 분산 소프트웨어 엔지니어링에서 병렬 효율성 원칙은 고처리량 데이터 파이프라인 전반에 적용되며, 여기서 아키텍처는 처리 병목 현상을 방지하기 위해 수집을 상태 조정과 분리합니다.

분리된 시스템 및 비교 분석: 모놀리식 서빙 대 공동 설계된 AI 팩토리
고동시성 아키텍처가 분리된 서버 측 처리로 진화함에 따라 엔지니어링 팀은 인프라 설계가 단위 경제성에 미치는 영향을 평가해야 합니다. 프로덕션 수준의 에이전틱 파이프라인을 배포하려면 메가와트당 처리량을 극대화하는 동시에 백만 토큰당 비용을 최소화하는 백엔드 시스템이 필요합니다. 조직은 기존 모놀리식 서빙 인스턴스가 에이전틱 워크로드를 유지할 수 있는지 아니면 전용 공동 설계 아키텍처가 필요한지 평가해야 합니다.
아키텍처 평가: 기존 서빙 대 분리형 플랫폼
각 GPU가 프리필 및 디코드 단계를 모두 처리하는 모놀리식 서빙 인스턴스를 배포하면 장기 컨텍스트 에이전틱 턴 중에 심각한 리소스 저활용으로 이어집니다. 모놀리식 배포는 간단한 초기 설정을 제공하지만, 디코드 단계에서는 연산 부족을 겪고 프리필 버스트 중에는 메모리 용량 제한에 직면합니다. 대조적으로 분리형 AI 팩토리 아키텍처는 컨텍스트 인코딩을 토큰 생성과 동적으로 분리하여 연산 및 메모리 도메인 모두에서 높은 활용도를 유지합니다.
아래 표는 다양한 추론 서빙 방법론에 걸친 주요 아키텍처 트레이드오프를 설명합니다.
| 아키텍처 모델 | 컨텍스트 확장 전략 | 프리필/디코드 할당 | 메가와트당 처리량 | 토큰 비용 경제성 |
|---|---|---|---|---|
| 모놀리식 단일 노드 서빙 | 정적 메모리 할당 | 강하게 결합됨 | 기준치 | 표준 고기준치 |
| 결합된 클러스터형 추론 | 공유 리소스 풀 | 동종 작업자 할당 | 보통 (워크로드 종속) | 표준 클러스터형 요율 |
| 분리된 공동 설계 AI 팩토리 | 분산 KV 캐시 라우팅 | 완전히 분리되고 독립적임 | GB300 대비 최대 30배 (보고됨) | GB300 대비 최대 35배 낮은 비용 |
이 구조적 변화는 추론 비용 디플레이션의 한 형태를 나타냅니다. 데이터 센터 용량의 고정된 메가와트마다 실질적으로 더 유용한 에이전틱 작업을 생성할 수 있습니다. 하드웨어 가속과 지능형 워크로드 라우팅을 결합하여 운영자는 복잡하고 장기적인 작업 전반에서 대화형 성능을 유지할 수 있습니다.

엔지니어링 체크리스트 및 검증 일정: 랙 규모 에이전틱 텔레메트리 최적화
데이터 센터 인프라와 애플리케이션 파이프라인을 고처리량 에이전틱 워크로드에 대비시키기 위해 기술 및 운영 팀은 구조화된 최적화 관행을 확립해야 합니다.
개발자 구현 체크리스트
- 프리필을 디코드 작업자로부터 분리: 프로세서 활용도를 극대화하기 위해 연산 집약적인 컨텍스트 수신과 메모리 바운드 토큰 생성을 독립적으로 확장되는 작업자 풀로 분리합니다.
- KV 캐시 인식 라우팅 구현: 관련 캐시된 컨텍스트를 이미 저장하고 있는 작업자 노드로 수신되는 다중 턴 요청을 라우팅하도록 API 게이트웨이와 로드 밸런서를 구성합니다.
- 저정밀도 양자화 평가: 출력 추론 안정성을 검증하는 동시에 메모리 풋프린트를 줄이기 위해 대상 모델 전체에서 NVFP4 및 혼합 정밀도 실행 경로를 벤치마킹합니다.
운영 및 경제성 체크리스트
- 메가와트당 처리량 모니터링: 격리된 단일 요청 지연 시간 벤치마크에만 의존하는 대신 라이브 워크로드 전반에서 메가와트당 지속되는 토큰을 추적합니다.
- 토큰 단위 경제성 감사: 지속 가능한 이익 마진을 유지하기 위해 다단계 에이전트 궤적 전반에서 백만 토큰당 총체적인 인프라 비용을 측정합니다.
- 첫 토큰 생성 시간(TTFT) 프로파일링: 고처리량 일괄 처리가 대화형 사용자 경험을 저해하지 않도록 긴 컨텍스트 프리필 단계 동안 초기 응답 지연 시간을 모니터링합니다.
이러한 운영 방법론을 채택하면 엔지니어링 팀은 엄격한 인프라 비용 거버넌스를 유지하면서 반응형 장기 에이전틱 시스템을 배포할 수 있습니다.
자주 묻는 질문 (FAQ)
에이전틱 AI 워크로드가 일반 챗봇 쿼리보다 15배 더 많은 토큰을 소모하는 이유는 무엇인가요?
분리형 서빙은 AI 팩토리의 메가와트당 처리량을 어떻게 개선하나요?
Blackwell GB300 NVL72와 Vera Rubin NVL72의 효율성 지표 차이는 무엇인가요?
엔지니어링 팀을 위한 핵심 시사점
Vera Rubin NVL72 플랫폼 전반에서 입증된 하드웨어 발전은 컴퓨팅 인프라의 필수적인 변화를 강조합니다. 확장 가능한 AI 운영에는 실리콘, 메모리 아키텍처, 소프트웨어 런타임 전반에 걸친 풀스택 공동 설계가 필요합니다. 다단계 자율 에이전트가 엔터프라이즈 소프트웨어의 표준 인터페이스가 됨에 따라 기존 모놀리식 서빙 모델은 분리된 메모리 중심 시스템으로 대체되고 있습니다.
인프라 아키텍트와 엔지니어링 리더에게 이 고처리량 시대를 탐색하려면 데이터 센터 파이프라인 전반에 걸쳐 분리된 시스템 원칙을 채택해야 합니다. 분리형 서빙, 분산 컨텍스트 캐싱, 지능형 워크로드 라우팅을 구현함으로써 조직은 고정된 유틸리티 전력 예산 내에서 에이전틱 지능을 효율적으로 확장할 수 있는 탄력적인 컴퓨팅 아키텍처를 구축할 수 있습니다.
Share this article



