NVIDIA выпускает Rubin NVL72? Новые данные о производительности на уровне кремния показывают, что платформа Vera Rubin NVL72 обеспечивает до 30 раз более высокую пропускную способность на мегаватт и в 35 раз более низкие затраты на токены для рабочих нагрузок агентного ИИ по сравнению с GB300 NVL72 в протестированной конфигурации AgentX, устанавливая новый ориентир аппаратной эффективности для центров обработки данных с ограничениями по питанию. По мере перехода автономных программных агентов от экспериментальных одношаговых промптов к многоэтапным производственным конвейерам вычислительные потребности стремительно растут. Данные использования OpenRouter, на которые ссылается NVIDIA, показывают, что один агентный запрос потребляет примерно в 15 раз больше токенов, чем обычный запрос в чате, поскольку агенты многократно запрашивают базы данных, извлекают внешние документы, порождают субагентов и поддерживают память с большим контекстом. Чтобы поддерживать эту высокую плотность пропускной способности в рамках фиксированных лимитов мощности дата-центров, серверные архитектуры переходят к глубокому совместному проектированию аппаратного и программного обеспечения.
Главное в отрасли и разбор новостей: Vera Rubin NVL72 для масштабирования агентного ИИ
Краткий обзор
- Данные о производительности на кремнии, опубликованные 24 августа 2026 года, показывают, что Vera Rubin NVL72 обеспечивает до 30 раз более высокую пропускную способность на мегаватт по сравнению с GB300 NVL72 в задачах агентного кодирования. Результаты измерены NVIDIA с использованием рабочей нагрузки SemiAnalysis AgentX и в настоящее время ожидают проверки SemiAnalysis.
- Многошаговые автономные агенты потребляют примерно в 15 раз больше токенов, чем стандартные взаимодействия с чат-ботами, из-за чего доступность электроэнергии, пропускная способность на мегаватт и экономика токенов становятся критически важными ограничениями для ИИ-инфраструктуры.
- Платформа объединяет дезагрегированное обслуживание, распределенное кэширование KV, маршрутизацию с учетом KV, точность NVFP4, сетевую инфраструктуру стоечного масштаба и комплексное копроектирование оборудования и ПО, что способствует заявленному NVIDIA снижению стоимости токенов до 35 раз по сравнению с GB300 NVL72 в тестируемой конфигурации AgentX.
Переход от базовых интерфейсов чат-ботов к автономным агентским рабочим процессам стимулирует структурную трансформацию проектирования дата-центров. Стандартные одношаговые взаимодействия обычно работают в рамках лаконичных границ ввода-вывода от 1 000 до 8 000 токенов. В противоположность этому, автономные агенты выполняют итеративные циклы рассуждений, где каждый вызов инструмента, обращение к базе данных и промежуточный результат накапливаются в контекстном окне последующих шагов. Этот накапливающийся контекст создает нерегулярные всплески вычислений, за которыми следуют периоды сетевой задержки, что создает нагрузку на традиционные инференс-серверы, разработанные для статических нагрузок «вопрос-ответ».
Для оценки производительности инфраструктуры в таких реалистичных условиях аппаратные бенчмарки отходят от оценки последовательностей фиксированной длины в пользу динамического воспроизведения сессий. Используя набор тестов SemiAnalysis AgentX, компания NVIDIA измерила устойчивую пропускную способность системы на основе воспроизведенных траекторий кодирования производственного уровня от ведущих моделей, включая DeepSeek V4 Pro, Kimi K3 и GLM-5.3. Записанные сеансы сохраняют реалистичный рост контекста, интервалы вызова инструментов и шаблоны порождения субагентов для тестирования того, насколько эффективно аппаратное обеспечение преобразует сырую мощность в полезный результат, как подробно описано в техническом анонсе корпорации NVIDIA. Результаты Vera Rubin отражают эти предварительные измерения и в настоящее время проходят экспертную оценку SemiAnalysis.

Измеренный скачок эффективности всей платформы Vera Rubin демонстрирует серьезный сдвиг в подходах к оценке платформ ускоренных вычислений. В центрах обработки данных с ограниченным энергопотреблением пропускная способность на мегаватт определяет общую операционную емкость, а стоимость миллиона токенов определяет валовую маржу. Результаты бенчмарков показывают, что Blackwell GB300 NVL72 обеспечивает до 15 раз более высокую пропускную способность на мегаватт и в 10 раз более низкую стоимость токенов по сравнению с системами Hopper H200. Архитектура Vera Rubin расширяет эту кривую эффективности еще сильнее, достигая до 30 раз более высокой пропускной способности на мегаватт по сравнению с GB300 при интерактивных целевых показателях обслуживания в 160 токенов в секунду на пользователя в рабочих нагрузках DeepSeek V4 Pro, как сообщается в отчете в блоге для разработчиков NVIDIA.

Архитектурные особенности: дезагрегированное обслуживание и маршрутизация KV-кэша
Прирост производительности архитектуры Rubin обусловлен решением фундаментального физического несоответствия между этапами префилла (предварительного заполнения) и декодирования при инференсе больших языковых моделей. Фаза префилла обрабатывает входящий промпт и ограничена вычислительными мощностями, получая преимущества от высокой пропускной способности параллельной арифметики. Напротив, фаза декодирования генерирует токены последовательно и обычно более чувствительна к пропускной способности памяти, особенно при меньших размерах интерактивных батчей, поскольку генерация токенов многократно обращается к весам модели и состоянию KV.
Чтобы устранить это операционное трение, современные архитектуры ИИ-фабрик реализуют дезагрегированное обслуживание. Этот метод разделяет выполнение префилла и декодирования между независимо масштабируемыми пулами воркеров, позволяя каждому этапу масштабироваться отдельно и динамически согласовывать скорость генерации в серверном кластере.
Оптимизация памяти: распределенное кэширование и домены масштабирования NVLink
В долгосрочных агентских сессиях повторное вычисление ранее обработанных токенов создает огромную вычислительную избыточность. Для сохранения эффективности фреймворки развертывания используют распределенное кэширование ключей-значений (KV) в высокоскоростном домене межсоединений, позволяя графическим процессорам совместно использовать и повторно использовать контекст без избыточных вычислений префилла.
На приведенной ниже схеме показано архитектурное разделение между дезагрегированной обработкой префилла и декодированием с учетом KV:
[Входящий многошаговый запрос агента (накопленный контекст)]
│
▼
[ Пул воркеров дезагрегированного префилла ] ──> Ускоренное кодирование контекста
│
▼ (Передача состояния контекста через высокоскоростную фабрику)
[ Диспетчер маршрутизации с учетом KV (Dynamo) ] ──> Соответствующий узел-воркер с кэшем
│
▼
[ Пул воркеров дезагрегированного декодирования ] ──> Генерация токенов с низкими задержками
Для поддержки этих распределенных методов работы с памятью система использует коммутацию межсоединений шестого поколения, которая обеспечивает существенно более высокую скорость передачи пакетов и меньшую задержку по сравнению со стандартными сетями. Объединяя оптимизированные ядра CUDA, среды выполнения вроде TensorRT-LLM и координационные фреймворки вроде NVIDIA Dynamo, уровень обслуживания направляет запросы напрямую на узлы выполнения, в которых уже хранится соответствующий закэшированный контекст. NVIDIA заявляет, что технологии управления питанием DSX MaxLPS позволяют выделять до 40% больше графических процессоров в рамках того же бюджета мощности, дополнительно максимизируя пропускную способность в масштабе предприятия.

Этот полностековый подход демонстрирует более широкий технический принцип: масштабирование современных рабочих нагрузок ИИ требует устранения избыточных вычислений и оптимизации передачи памяти на каждом уровне системы. В распределенной разработке ПО принципы параллельной эффективности применимы к конвейерам данных с высокой пропускной способностью, где архитектуры отделяют прием данных от согласования состояния для предотвращения узких мест обработки.

Девятиуровневые системы и сравнительный анализ: монолитное обслуживание против совместно спроектированных ИИ-фабрик
Поскольку архитектуры с высокой степенью параллелизма эволюционируют в сторону дезагрегированной обработки на стороне сервера, инженерные команды должны оценивать, как дизайн инфраструктуры влияет на удельные экономические показатели. Развертывание производственных агентских конвейеров требует бэкенд-систем, которые максимизируют пропускную способность на мегаватт, одновременно минимизируя стоимость миллиона токенов. Организации должны оценить, способны ли традиционные монолитные экземпляры обслуживания выдерживать агентные нагрузки или требуются специализированные архитектуры совместного проектирования.
Архитектурная оценка: традиционное обслуживание против дезагрегированных платформ
Развертывание монолитных экземпляров обслуживания, где каждый GPU обрабатывает как префилл, так и декодирование, приводит к серьезному недоиспользованию ресурсов во время долгих агентских сессий. Хотя монолитные развертывания предлагают простую первоначальную настройку, они страдают от нехватки вычислительных ресурсов на фазах декодирования и ограничений емкости памяти во время всплесков префилла. Напротив, дезагрегированные архитектуры ИИ-фабрик динамически отделяют кодирование контекста от генерации токенов, поддерживая высокую степень использования как вычислительных ресурсов, так и памяти.
В таблице ниже описаны ключевые архитектурные компромиссы для различных методологий инференса:
| Архитектурная модель | Стратегия масштабирования контекста | Распределение Префилл/Декодирование | Пропускная способность на мегаватт | Экономика стоимости токенов |
|---|---|---|---|---|
| Монолитное обслуживание на одном узле | Статическое выделение памяти | Жестко связанное | Базовый уровень | Стандартный высокий базовый уровень |
| Связанный кластерный инференс | Общие пулы ресурсов | Однородное распределение воркеров | Умеренная (зависит от рабочей нагрузки) | Стандартный кластерный тариф |
| Дезагрегированная совместно спроектированная ИИ-фабрика | Маршрутизация с распределенным KV-кэшем | Полностью дезагрегированная и независимая | До 30x по сравнению с GB300 (по данным отчета) | До 35x ниже стоимость по сравнению с GB300 |
Этот структурный сдвиг представляет собой форму дефляции стоимости инференса: каждый фиксированный мегаватт емкости дата-центра может производить значительно больше полезной агентской работы. Объединяя аппаратное ускорение с интеллектуальной маршрутизацией рабочей нагрузки, операторы могут поддерживать интерактивную производительность в сложных задачах с большим горизонтом планирования.

Инженерный контрольный список и графики проверки: оптимизация телеметрии агентов стоечного масштаба
Чтобы подготовить инфраструктуру дата-центров и прикладные конвейеры к высокопроизводительным агентным нагрузкам, техническим и операционным командам следует внедрить практики структурированной оптимизации.
Чек-лист реализации для разработчиков
- Отделите воркеров префилла от воркеров декодирования: Разделите ресурсоемкий прием контекста и генерацию токенов, зависящую от пропускной способности памяти, на независимо масштабируемые пулы воркеров для максимизации загрузки процессора.
- Внедрите маршрутизацию с учетом KV-кэша: Настройте шлюзы API и балансировщики нагрузки для перенаправления входящих многошаговых запросов на узлы воркеров, где уже хранится соответствующий закэшированный контекст.
- Оцените квантование с более низкой разрядностью: Проведите бенчмаркинг путей выполнения NVFP4 и смешанной точности для целевых моделей, чтобы уменьшить объем памяти и одновременно проверить стабильность логических выводов.
Чек-лист для операционных и экономических отделов
- Контролируйте пропускную способность на мегаватт: Отслеживайте стабильные токены на мегаватт для живых нагрузок, а не полагайтесь исключительно на изолированные бенчмарки задержки одиночных запросов.
- Аудит экономики токенов: Измеряйте совокупные затраты на инфраструктуру на миллион токенов по многошаговым траекториям агентов для поддержания устойчивой прибыли.
- Анализируйте время до получения первого токена (TTFT): Отслеживайте начальную задержку отклика во время фаз префилла с большим контекстом, чтобы гарантировать, что пакетная обработка с высокой пропускной способностью не ухудшает интерактивный пользовательский опыт.
Принятие этих операционных методологий позволяет инженерным командам развертывать отзывчивые долгосрочные агентные системы при сохранении строгого контроля над затратами на инфраструктуру.
Часто задаваемые вопросы (FAQ)
Почему рабочие нагрузки агентного ИИ потребляют в 15 раз больше токенов, чем стандартные запросы к чат-боту?
Как дезагрегированное обслуживание повышает пропускную способность ИИ-фабрики на мегаватт?
Какова разница между метриками эффективности Blackwell GB300 NVL72 и Vera Rubin NVL72?
Основные выводы для инженерных команд
Аппаратные достижения, продемонстрированные на платформе Vera Rubin NVL72, подчеркивают ключевой сдвиг в вычислительной инфраструктуре: масштабируемые ИИ-операции требуют полностекового проектирования кремния, архитектур памяти и программных сред выполнения. Поскольку многоэтапные автономные агенты становятся стандартным интерфейсом для корпоративного ПО, традиционные монолитные модели обслуживания заменяются дезагрегированными, ориентированными на память системами.
Для инфраструктурных архитекторов и технических лидеров навигация в эту эпоху высокой пропускной способности требует внедрения принципов дезагрегированных систем в конвейеры дата-центров. Реализуя дезагрегированное обслуживание, распределенное кэширование контекста и интеллектуальную маршрутизацию рабочих нагрузок, организации могут создавать устойчивые вычислительные архитектуры, способные эффективно масштабировать агентский интеллект в рамках фиксированных бюджетов мощности коммунальных сетей.
Share this article



