¿NVIDIA envía Rubin NVL72? Por qué se disparó la eficiencia energética

opoinstall
2026-08-25
5 min read

¿NVIDIA envía Rubin NVL72? Nuevos datos de rendimiento en silicio revelan que la plataforma Vera Rubin NVL72 ofrece un rendimiento hasta 30 veces mayor por megavatio y costos de tokens 35 veces menores para cargas de trabajo de IA agéntica en comparación con GB300 NVL72 bajo la configuración AgentX probada, estableciendo una nueva línea base de eficiencia de hardware para fábricas de IA con limitaciones de energía. A medida que los agentes de software autónomos pasan de las indicaciones experimentales de un solo turno a los canales de producción de varios pasos, la demanda computacional se está expandiendo rápidamente. Los datos de uso de OpenRouter citados por NVIDIA indican que una sola solicitud agéntica consume aproximadamente 15 veces más tokens que una solicitud de chat normal, debido a que los agentes consultan bases de datos repetidamente, recuperan documentos externos, generan subagentes y mantienen memoria de contexto largo. Para sostener este rendimiento de alta densidad dentro de los límites de energía fijos del centro de datos, las arquitecturas de servidores están evolucionando hacia un codiseño extremo entre hardware y software.

Realineación central de la industria y desglose de noticias: Vera Rubin NVL72 para la escala de IA agéntica

De un vistazo

  • Los datos de rendimiento en silicio publicados el 24 de agosto de 2026 muestran que Vera Rubin NVL72 ofrece un rendimiento hasta 30 veces mayor por megavatio que GB300 NVL72 en cargas de trabajo de codificación agéntica, con resultados medidos por NVIDIA utilizando la carga de trabajo SemiAnalysis AgentX y actualmente pendientes de revisión por parte de SemiAnalysis.
  • Los agentes autónomos de varios pasos consumen aproximadamente 15 veces más tokens que las interacciones estándar con chatbots, lo que convierte la disponibilidad de energía, el rendimiento por megavatio y la economía de tokens en limitaciones cada vez más importantes para la infraestructura de IA.
  • La plataforma combina servicio desagregado, almacenamiento en caché de KV distribuido, enrutamiento consciente de KV, precisión NVFP4, redes a escala de rack y un codiseño más amplio de hardware y software, lo que contribuye a las reducciones informadas por NVIDIA en el costo de tokens de hasta 35x frente a GB300 NVL72 bajo la configuración AgentX probada.

La transición de interfaces de chat básicas a flujos de trabajo agénticos autónomos está impulsando una transformación estructural en la ingeniería de centros de datos. Las interacciones estándar de un solo turno operan típicamente dentro de límites de entrada y salida concisos que oscilan entre 1000 y 8000 tokens. En contraste, los agentes autónomos ejecutan bucles de razonamiento iterativo donde cada invocación de herramienta, recuperación de base de datos y salida intermedia se acumula en la ventana de contexto de los pasos subsiguientes. Este contexto compuesto crea ráfagas irregulares de computación seguidas de períodos de latencia de red, poniendo a prueba a los servidores de inferencia tradicionales diseñados para cargas de trabajo estáticas de solicitud y respuesta.

Para evaluar el rendimiento de la infraestructura bajo estas condiciones realistas, los puntos de referencia de hardware se están alejando de las evaluaciones de secuencias de longitud fija hacia la reproducción dinámica de sesiones. Utilizando el conjunto de pruebas SemiAnalysis AgentX, NVIDIA midió el rendimiento sostenido del sistema a través de trayectorias de codificación de estilo de producción reproducidas de modelos líderes, incluidos DeepSeek V4 Pro, Kimi K3 y GLM-5.3. Las sesiones registradas preservan el crecimiento realista del contexto, los intervalos de llamadas a herramientas y los patrones de generación de subagentes para probar cuán eficientemente el hardware convierte la energía bruta en resultados utilizables, tal como se detalla en el anuncio técnico corporativo de NVIDIA. Los resultados de Vera Rubin reflejan estas primeras mediciones y actualmente están pendientes de revisión por parte de SemiAnalysis.

Imagen técnica de NVIDIA que ilustra el rendimiento de la IA agéntica y las métricas de eficiencia de inferencia

El salto de eficiencia medido en toda la plataforma Vera Rubin demuestra un cambio importante en la forma en que se evalúan las plataformas de computación acelerada. En las fábricas de IA con limitaciones de energía, el rendimiento por megavatio determina la capacidad operativa total, mientras que el costo por millón de tokens rige los márgenes brutos. Los resultados de los puntos de referencia indican que Blackwell GB300 NVL72 ofrece un rendimiento hasta 15 veces mayor por megavatio y costos de tokens 10 veces menores en comparación con los sistemas Hopper H200. La arquitectura Vera Rubin amplía aún más esta curva de eficiencia, logrando un rendimiento hasta 30 veces mayor por megavatio que GB300 en objetivos de servicio interactivo de 160 tokens por segundo por usuario en cargas de trabajo de DeepSeek V4 Pro, según se informa en el informe del blog para desarrolladores de NVIDIA.

Gráfico comparativo que compara la inferencia tradicional de secuencia fija con los requisitos complejos de carga de trabajo agéntica

Desconexión arquitectónica interna: servicio desagregado y enrutamiento de caché KV

Las ganancias de rendimiento de la arquitectura Rubin provienen de abordar el desajuste físico fundamental entre las etapas de prellenado y decodificación de la inferencia de modelos de lenguaje grande. La fase de prellenado procesa la indicación entrante y está limitada por la computación, beneficiándose de un alto rendimiento aritmético paralelo. En contraste, la fase de decodificación genera tokens secuencialmente y suele ser más sensible al ancho de banda de la memoria, especialmente en tamaños de lotes interactivos más pequeños, debido a que la generación de tokens accede repetidamente a los pesos del modelo y al estado KV.

Para eliminar esta fricción operativa, las arquitecturas modernas de fábricas de IA implementan servicios desagregados. Esta técnica separa la ejecución del prellenado y la decodificación en grupos de trabajadores escalados de forma independiente, lo que permite que cada etapa escale por separado y coincida con las tasas de generación de forma dinámica en todo el clúster de servidores.

Optimización de memoria: almacenamiento en caché distribuido y dominios de escala NVLink

En sesiones agénticas de larga duración, volver a computar tokens procesados previamente crea una redundancia computacional masiva. Para preservar la eficiencia, los marcos de servicio despliegan almacenamiento en caché distribuido de clave-valor (KV) en el dominio de interconexión de alta velocidad, lo que permite a las GPU compartir y reutilizar el contexto sin cálculos de prellenado redundantes.

El siguiente diagrama ilustra la separación arquitectónica entre el procesamiento de prellenado desagregado y la generación de decodificación consciente de KV:

[Solicitud de agente de múltiples pasos entrante (Contexto acumulativo)]
                           │
                           ▼
    [ Grupo de trabajadores de prellenado desagregado ] ──> Codificación de contexto acelerada
                           │
                           ▼ (Transferencia de estado de contexto a través de estructura de gran ancho de banda)
    [ Distribuidor de enrutamiento consciente de KV (Dynamo) ] ──> Coincide con nodo de trabajador en caché
                           │
                           ▼
    [ Grupo de trabajadores de decodificación desagregado ]  ──> Generación de tokens de baja latencia

Para admitir estas técnicas de memoria distribuida, el sistema utiliza conmutación de interconexión de sexta generación que ofrece tasas de paquetes sustancialmente más altas y menor latencia que las redes comerciales. Abarcando núcleos CUDA optimizados, bibliotecas de tiempo de ejecución como TensorRT-LLM y marcos de coordinación como NVIDIA Dynamo, la capa de servicio enruta las solicitudes directamente a los nodos de ejecución que ya contienen el contexto almacenado en caché relevante. NVIDIA afirma que sus tecnologías de administración de energía DSX MaxLPS pueden aprovisionar hasta un 40% más de GPU dentro del mismo presupuesto de megavatios, maximizando aún más el rendimiento a escala de servicios públicos.

Gráfico de comparación de rendimiento que muestra que Vera Rubin NVL72 ofrece un mayor rendimiento por megavatio que GB300 NVL72

Este enfoque de pila completa demuestra un principio técnico más amplio: escalar las cargas de trabajo de IA modernas requiere eliminar el cálculo redundante y optimizar el transporte de memoria en cada capa del sistema. En la ingeniería de software distribuido, los principios de eficiencia paralela se aplican en canales de datos de alto rendimiento, donde las arquitecturas separan la ingesta de la conciliación de estados para evitar cuellos de botella en el procesamiento.

Gráfico que muestra que GB300 NVL72 ofrece una mejor eficiencia de costo de tokens en comparación con el hardware H200 de generación anterior

Sistemas desacoplados y análisis de comparación: servicio monolítico frente a fábricas de IA codiseñadas

A medida que las arquitecturas de alta concurrencia evolucionan hacia un procesamiento desagregado del lado del servidor, los equipos de ingeniería deben evaluar cómo el diseño de la infraestructura afecta la economía unitaria. El despliegue de canales agénticos de nivel de producción requiere sistemas backend que maximicen el rendimiento por megavatio y minimicen el costo por millón de tokens. Las organizaciones deben evaluar si las instancias de servicio monolíticas tradicionales pueden sostener cargas de trabajo agénticas o si se requieren arquitecturas dedicadas y codiseñadas.

Evaluación arquitectónica: servicio tradicional frente a plataformas desagregadas

Implementar instancias de servicio monolíticas donde cada GPU maneja tanto las etapas de prellenado como de decodificación conduce a una subutilización severa de los recursos durante los turnos agénticos de contexto largo. Si bien las implementaciones monolíticas ofrecen una configuración inicial sencilla, sufren de escasez de computación durante las fases de decodificación y limitaciones de capacidad de memoria durante las ráfagas de prellenado. En contraste, las arquitecturas de fábricas de IA desagregadas desacoplan dinámicamente la codificación de contexto de la generación de tokens, manteniendo una alta utilización en los dominios de computación y memoria.

La siguiente tabla describe las compensaciones arquitectónicas clave en diferentes metodologías de servicio de inferencia:

Modelo de arquitectura Estrategia de escala de contexto Asignación de prellenado/decodificación Rendimiento por megavatio Economía de costos de tokens
Servicio monolítico de nodo único Asignación de memoria estática Estrechamente acoplado Línea base Línea base alta estándar
Inferencia agrupada acoplada Grupos de recursos compartidos Asignación de trabajadores homogéneos Moderado (dependiente de la carga de trabajo) Tasa agrupada estándar
Fábrica de IA codiseñada desagregada Enrutamiento de caché KV distribuido Totalmente desagregado e independiente Hasta 30x vs GB300 (Reportado) Costo hasta 35x menor vs GB300

Este cambio estructural representa una forma de deflación en el costo de inferencia: cada megavatio fijo de capacidad del centro de datos puede producir un trabajo agéntico materialmente más útil. Al combinar la aceleración de hardware con el enrutamiento inteligente de la carga de trabajo, los operadores pueden mantener un rendimiento interactivo en tareas complejas y de largo alcance.

Descripción general de la infraestructura de fábrica de IA de pila completa con bastidores de servidores de computación, almacenamiento y redes

Lista de verificación de ingeniería y cronogramas de verificación: optimización de la telemetría agéntica a escala de rack

Para preparar la infraestructura del centro de datos y los canales de aplicaciones para cargas de trabajo agénticas de alto rendimiento, los equipos técnicos y de operaciones deben establecer prácticas de optimización estructuradas.

Lista de verificación para la implementación de desarrolladores

  • Desacoplar el prellenado de los trabajadores de decodificación: Separe la ingesta de contexto pesada en computación de la generación de tokens limitada por memoria en grupos de trabajadores escalados de forma independiente para maximizar la utilización del procesador.
  • Implementar enrutamiento consciente de la caché KV: Configure pasarelas de API y equilibradores de carga para enrutar las solicitudes entrantes de múltiples turnos a nodos de trabajadores que ya almacenan en caché el contexto relevante.
  • Evaluar la cuantización de menor precisión: Realice pruebas comparativas de rutas de ejecución de precisión mixta y NVFP4 en modelos de destino para reducir la huella de memoria mientras verifica la estabilidad del razonamiento de salida.

Lista de verificación de operaciones y economía

  • Supervisar el rendimiento por megavatio: Realice un seguimiento de los tokens sostenidos por megavatio en cargas de trabajo activas en lugar de depender exclusivamente de puntos de referencia aislados de latencia de solicitud única.
  • Auditar la economía unitaria de tokens: Mida el costo total de infraestructura por millón de tokens a través de trayectorias de agentes de múltiples pasos para mantener márgenes de beneficio sostenibles.
  • Perfilar el tiempo hasta el primer token (TTFT): Supervise la latencia de respuesta inicial durante las fases de prellenado de contexto largo para garantizar que el procesamiento por lotes de alto rendimiento no comprometa la experiencia interactiva del usuario.

La adopción de estas metodologías operativas permite a los equipos de ingeniería implementar sistemas agénticos receptivos y de largo alcance mientras mantienen una estricta gobernanza de costos de infraestructura.

Preguntas frecuentes (FAQ)

¿Por qué las cargas de trabajo de IA agéntica consumen 15 veces más tokens que las consultas estándar de chatbot?
Los flujos de trabajo agénticos requieren razonamiento de múltiples pasos, consultas iterativas a bases de datos, invocaciones de herramientas y coordinación de subagentes. Debido a que el contexto acumulado de cada paso se convierte en la entrada para los turnos subsiguientes, las sesiones de agentes pueden crecer a cientos de miles de tokens, multiplicando el consumo total de tokens en comparación con las interacciones de chat de un solo turno.
¿Cómo mejora el servicio desagregado el rendimiento por megavatio de la fábrica de IA?
El servicio desagregado separa la etapa de prellenado, pesada en computación, de la etapa de decodificación, pesada en ancho de banda de memoria, en nodos de GPU especializados. Al optimizar cada clúster de hardware para su perfil computacional específico y hacer coincidir las tasas de generación, la arquitectura elimina los ciclos inactivos del procesador y maximiza la eficiencia energética.
¿Cuál es la diferencia entre las métricas de eficiencia de Blackwell GB300 NVL72 y Vera Rubin NVL72?
Mientras que Blackwell GB300 NVL72 ofrece un rendimiento hasta 15 veces mayor por megavatio que las arquitecturas Hopper en pruebas comparativas agénticas, Vera Rubin NVL72 logra un rendimiento hasta 30 veces mayor por megavatio y reduce los costos de tokens hasta 35 veces en comparación con GB300, proporcionando una frontera de eficiencia ampliada para modelos grandes de mezcla de expertos.

Conclusiones clave para los equipos de ingeniería

Los avances de hardware demostrados en la plataforma Vera Rubin NVL72 destacan un cambio esencial en la infraestructura informática: las operaciones de IA escalables requieren un codiseño de pila completa en silicio, arquitecturas de memoria y tiempos de ejecución de software. A medida que los agentes autónomos de varios pasos se convierten en la interfaz estándar para el software empresarial, los modelos de servicio monolíticos tradicionales están siendo reemplazados por sistemas desagregados y centrados en la memoria.

Para los arquitectos de infraestructura y líderes de ingeniería, navegar por esta era de alto rendimiento requiere adoptar principios de sistemas desacoplados en los canales del centro de datos. Al implementar servicios desagregados, almacenamiento en caché de contexto distribuido y enrutamiento inteligente de cargas de trabajo, las organizaciones pueden construir arquitecturas informáticas resilientes capaces de escalar la inteligencia agéntica de manera eficiente dentro de presupuestos de energía de servicios públicos fijos.

Share this article