A NVIDIA lançou o Rubin NVL72? Novos dados de desempenho em silício revelam que a plataforma Vera Rubin NVL72 oferece até 30 vezes mais rendimento por megawatt e custos de tokens 35 vezes menores para cargas de trabalho de IA agêntica em comparação com o GB300 NVL72 sob a configuração AgentX testada, estabelecendo uma nova linha de base de eficiência de hardware para fábricas de IA com restrição de energia. À medida que os agentes de software autônomos fazem a transição de prompts experimentais de turno único para pipelines de produção de várias etapas, a demanda computacional está se expandindo rapidamente. Os dados de uso do OpenRouter citados pela NVIDIA indicam que uma única solicitação agêntica consome cerca de 15 vezes mais tokens do que uma solicitação de chat comum, porque os agentes consultam repetidamente bancos de dados, recuperam documentos externos, geram subagentes e mantêm memória de longo contexto. Para sustentar esse rendimento de alta densidade dentro de limites de energia fixos de data centers, as arquiteturas de servidores estão migrando para um co-design extremo entre hardware e software.
Realinhamento Central da Indústria & Análise de Notícias: Vera Rubin NVL72 para Escala de IA Agêntica
Visão Geral
- Os dados de desempenho em silício divulgados em 24 de agosto de 2026 mostram que o Vera Rubin NVL72 oferece até 30 vezes mais rendimento por megawatt do que o GB300 NVL72 em cargas de trabalho de codificação agêntica, com resultados medidos pela NVIDIA usando a carga de trabalho AgentX do SemiAnalysis e atualmente aguardando revisão do SemiAnalysis.
- Agentes autônomos de várias etapas consomem cerca de 15 vezes mais tokens do que as interações padrão com chatbots, tornando a disponibilidade de energia, o rendimento por megawatt e a economia de tokens restrições cada vez mais importantes para a infraestrutura de IA.
- A plataforma combina atendimento desagregado, cache KV distribuído, roteamento ciente de KV, precisão NVFP4, rede em escala de rack e um co-design mais amplo entre hardware e software, contribuindo para as reduções relatadas pela NVIDIA nos custos de tokens de até 35x em relação ao GB300 NVL72 sob a configuração AgentX testada.
A transição de interfaces básicas de chatbot para fluxos de trabalho agênticos autônomos está impulsionando uma transformação estrutural na engenharia de data centers. As interações padrão de turno único normalmente operam dentro de limites concisos de entrada e saída que variam entre 1.000 e 8.000 tokens. Em contrapartida, os agentes autônomos executam loops de raciocínio iterativos onde cada invocação de ferramenta, recuperação de banco de dados e saída intermediária se acumula na janela de contexto das etapas subsequentes. Esse contexto cumulativo cria picos irregulares de computação seguidos por períodos de latência de rede, sobrecarregando os servidores de inferência tradicionais projetados para cargas de trabalho estáticas de solicitação e resposta.
Para avaliar o desempenho da infraestrutura sob essas condições realistas, os benchmarks de hardware estão migrando de avaliações de sequências de comprimento fixo para execuções dinâmicas de sessões. Usando o conjunto de benchmarks SemiAnalysis AgentX, a NVIDIA mediu o rendimento sustentado do sistema em trajetórias de codificação no estilo de produção reproduzidas de modelos líderes, incluindo DeepSeek V4 Pro, Kimi K3 e GLM-5.3. As sessões registradas preservam o crescimento realista do contexto, os intervalos de chamada de ferramenta e os padrões de criação de subagentes para testar a eficiência com que o hardware converte energia bruta em saída utilizable, conforme detalhado no anúncio técnico corporativo da NVIDIA. Os resultados do Vera Rubin refletem essas primeiras medições e estão atualmente aguardando a revisão do SemiAnalysis.

O salto de eficiência medido em toda a plataforma Vera Rubin demonstra uma mudança importante na forma como as plataformas de computação acelerada são avaliadas. Em fábricas de IA com restrição de energia, o rendimento por megawatt determina a capacidade operacional total, enquanto o custo por milhão de tokens rege as margens brutas. Os resultados dos benchmarks indicam que o Blackwell GB300 NVL72 oferece até 15 vezes mais rendimento por megawatt e custos de tokens 10 vezes menores em comparação aos sistemas Hopper H200. A arquitetura Vera Rubin estende essa curva de eficiência ainda mais, alcançando até 30 vezes mais rendimento por megawatt do que o GB300 em alvos de atendimento interativo de 160 tokens por segundo por usuário em cargas de trabalho do DeepSeek V4 Pro, conforme relatado no relatório do Blog do Desenvolvedor da NVIDIA.

Desconexão Arquitetural Interna: Atendimento Desagregado e Roteamento de Cache KV
Os ganhos de desempenho da arquitetura Rubin decorrem da resolução da incompatibilidade física fundamental entre os estágios de pré-preenchimento (prefill) e decodificação (decode) da inferência de grandes modelos de linguagem. A fase de pré-preenchimento processa o prompt de entrada e é limitada pela computação, beneficiando-se de um alto rendimento aritmético paralelo. Em contrapartida, a fase de decodificação gera tokens sequencialmente e geralmente é mais sensível à largura de banda da memória, especialmente em tamanhos de lote interativos menores, porque a geração de tokens acessa repetidamente os pesos do modelo e o estado KV.
Para eliminar esse atrito operacional, as arquiteturas modernas de fábricas de IA implementam atendimento desagregado. Essa técnica separa a execução de pré-preenchimento e decodificação em pools de trabalhadores dimensionados de forma independente, permitindo que cada estágio seja dimensionado de forma autônoma e corresponda dinamicamente às taxas de geração em todo o cluster de servidores.
Otimização de Memória: Cache Distribuído e Domínios de Escalonamento NVLink
Em sessões agênticas de longa duração, recomputar tokens processados anteriormente cria uma enorme redundância computacional. Para preservar a eficiência, as estruturas de atendimento implantam o cache distribuído de chave-valor (KV) em todo o domínio de interconexão de alta velocidade, permitindo que as GPUs compartilhem e reutilizem o contexto sem cálculos de pré-preenchimento redundantes.
O diagrama abaixo ilustra a separação arquitetônica entre o processamento de pré-preenchimento desagregado e a geração de decodificação ciente de KV:
[Solicitação de Agente Multietapa de Entrada (Contexto Cumulativo)]
│
▼
[ Pool de Trabalhadores de Pré-Preenchimento Desagregado ] ──> Codificação de Contexto Acelerada
│
▼ (Transferência de Estado de Contexto via Malha de Alta Largura de Banda)
[ Despachante de Roteamento Ciente de KV (Dynamo) ] ──> Corresponde ao Nó de Trabalhador em Cache
│
▼
[ Pool de Trabalhadores de Decodificação Desagregado ] ──> Geração de Tokens de Baixa Latência
Para dar suporte a essas técnicas de memória distribuída, o sistema utiliza comutação de interconexão de sexta geração que oferece taxas de pacotes substancialmente mais altas e menor latência do que as redes comerciais prontas para uso. Abrangendo kernels CUDA otimizados, bibliotecas de tempo de execução como TensorRT-LLM e estruturas de coordenação como o NVIDIA Dynamo, a camada de atendimento direciona as solicitações diretamente para os nós de execução que já possuem o contexto em cache relevante. A NVIDIA afirma que suas tecnologias de gerenciamento de energia DSX MaxLPS podem provisionar até 40% mais GPUs dentro do mesmo orçamento de megawatts, maximizando ainda mais o rendimento em escala de utilidade pública.

Essa abordagem de pilha completa demonstra um princípio técnico mais amplo: dimensionar cargas de trabalho modernas de IA exige a eliminação de computação redundante e a otimização do transporte de memória em todas as camadas do sistema. Na engenharia de software distribuída, os princípios de eficiência paralela se aplicam em pipelines de dados de alto rendimento, onde as arquiteturas separam a ingestão da reconciliação de estado para evitar gargalos de processamento.

Sistemas Desacoplados & Análise Comparativa: Atendimento Monolítico vs. Fábricas de IA Co-projetadas
À medida que as arquiteturas de alta concorrência evoluem para o processamento desagregado no lado do servidor, as equipes de engenharia devem avaliar como o design da infraestrutura impacta a economia unitária. A implantação de pipelines agênticos de nível de produção requer sistemas de backend que maximizem o rendimento por megawatt, minimizando o custo por milhão de tokens. As organizações devem avaliar se as instâncias tradicionais de atendimento monolítico podem sustentar cargas de trabalho agênticas ou se são necessárias arquiteturas dedicadas e co-projetadas.
Avaliação Arquitetural: Atendimento Tradicional vs. Plataformas Desagregadas
A implantação de instâncias de atendimento monolítico onde cada GPU lida com os estágios de pré-preenchimento e decodificação leva a uma subutilização severa de recursos durante turnos agênticos de longo contexto. Embora as implantações monolíticas ofereçam uma configuração inicial simples, elas sofrem com a falta de computação durante as fases de decodificação e limites de capacidade de memória durante os picos de pré-preenchimento. Em contrapartida, as arquiteturas de fábricas de IA desagregadas desacoplam dinamicamente a codificação de contexto da geração de tokens, mantendo alta utilização nos domínios de computação e memória.
A tabela abaixo descreve as principais compensações arquitetônicas em diferentes metodologias de atendimento por inferência:
| Modelo de Arquitetura | Estratégia de Escalonamento de Contexto | Alocação de Pré-preenchimento/Decodificação | Rendimento por Megawatt | Economia de Custo de Token |
|---|---|---|---|---|
| Atendimento Monolítico de Nó Único | Alocação de Memória Estática | Estritamente Acoplado | Linha de Base | Linha de Base Alta Padrão |
| Inferência Agrupada Acoplada | Pools de Recursos Compartilhados | Alocação Homogênea de Trabalhadores | Moderado (Dependente da Carga de Trabalho) | Taxa Agrupada Padrão |
| Fábrica de IA Co-projetada Desagregada | Roteamento de Cache KV Distribuído | Totalmente Desagregado e Independente | Até 30x vs GB300 (Relatado) | Custo até 35x Menor vs GB300 |
Essa mudança estrutural representa uma forma de deflação nos custos de inferência: cada megawatt fixo de capacidade de data center pode produzir muito mais trabalho agêntico útil. Ao combinar a aceleração de hardware com o roteamento inteligente de cargas de trabalho, os operadores podem sustentar o desempenho interativo em tarefas complexas e de longo prazo.

Lista de Verificação de Engenharia & Cronogramas de Verificação: Otimizando a Telemetria Agêntica em Escala de Rack
Para preparar a infraestrutura de data center e os pipelines de aplicativos para cargas de trabalho agênticas de alto rendimento, as equipes técnicas e de operações devem estabelecer práticas estruturadas de otimização.
Lista de Verificação de Implementação para Desenvolvedores
- Desacoplar Trabalhadores de Pré-preenchimento de Decodificação: Separe a ingestão de contexto pesada em computação da geração de tokens limitada por memória em pools de trabalhadores dimensionados independentemente para maximizar a utilização do processador.
- Implementar Roteamento Ciente de Cache KV: Configure gateways de API e balanceadores de carga para direcionar solicitações multietapa de entrada para nós de trabalhadores que já armazenam o contexto em cache relevante.
- Avaliar Quantização de Menor Precisão: Realize benchmarks de caminhos de execução NVFP4 e de precisão mista em modelos de destino para reduzir a pegada de memória enquanto verifica a estabilidade do raciocínio de saída.
Lista de Verificação de Operações & Economia
- Monitorar o Rendimento por Megawatt: Acompanhe os tokens sustentados por megawatt em cargas de trabalho ativas, em vez de depender exclusivamente de benchmarks isolados de latência de solicitação única.
- Auditar a Economia de Unidade de Token: Meça o custo total de infraestrutura por milhão de tokens em trajetórias de agentes de várias etapas para manter margens de lucro sustentáveis.
- Perfil de Tempo até o Primeiro Token (TTFT): Monitore a latência de resposta inicial durante as fases de pré-preenchimento de longo contexto para garantir que o lote de alto rendimento não comprometa a experiência interativa do usuário.
A adoção dessas metodologias operacionais permite que as equipes de engenharia implantem sistemas agênticos responsivos e de longo prazo, mantendo uma governança rigorosa de custos de infraestrutura.
Perguntas Frequentes (FAQ)
Por que as cargas de trabalho de IA agêntica consomem 15 vezes mais tokens do que as consultas padrão de chatbot?
Como o atendimento desagregado melhora o rendimento por megawatt da fábrica de IA?
Qual é a diferença entre as métricas de eficiência do Blackwell GB300 NVL72 e do Vera Rubin NVL72?
Principais Conclusões para Equipes de Engenharia
Os avanços de hardware demonstrados na plataforma Vera Rubin NVL72 destacam uma mudança essencial na infraestrutura de computação: operações de IA escaláveis exigem um co-design de pilha completa em silício, arquiteturas de memória e tempos de execução de software. À medida que os agentes autônomos de várias etapas se tornam a interface padrão para software corporativo, os modelos de atendimento monolíticos tradicionais estão sendo substituídos por sistemas desagregados e centrados na memória.
Para arquitetos de infraestrutura e líderes de engenharia, navegar por esta era de alto rendimento exige a adoção de princípios de sistemas desacoplados em pipelines de data centers. Ao implementar atendimento desagregado, cache de contexto distribuído e roteamento inteligente de cargas de trabalho, as organizações podem construir arquiteturas de computação resilientes capazes de dimensionar a inteligência agêntica de forma eficiente dentro de orçamentos fixos de energia de utilidade pública.
Share this article



