DeepDigest
Leiphone · · ~4 мин

Vera Rubin Agent от NVIDIA: рост производительности до 30 раз на Hot Chips 2026

На Hot Chips 2026 NVIDIA представила результаты тестирования Vera Rubin NVL72, продемонстрировав рост производительности до 30 раз. Компания меняет подход к агентным вычислениям, разбивая задачу вывода на разные типы вычислений. Groq 3 LPX, запущенный в массовое производство, обеспечивает высокую скорость вывода токенов с низкой задержкой.

LLM
Vera Rubin Agent от NVIDIA: рост производительности до 30 раз на Hot Chips 2026

На конференции Hot Chips 2026 компания NVIDIA представила результаты тестирования Vera Rubin NVL72. В условиях DeepSeek V4-Pro (один пользователь, 160 токенов в секунду) Vera Rubin NVL72 демонстрирует прирост производительности до 30 раз по сравнению с GB300 NVL72 (в пересчёте на мегаватт).

NVIDIA меняет подход к повышению эффективности агентных вычислений: задача вывода разбивается на разные типы вычислительных задач. В системе Vera Rubin разные компоненты отвечают за разные функции:
* Vera Rubin NVL72 — вычисления с крупными моделями;
* Groq 3 LPX — генерация токенов с низкой задержкой;
* Vera CPU — организация инструментов, выполнение кода и обработка данных;
* Spectrum-X — соединение вычислительных ресурсов, данных и хранилища.

Для тестирования использовалась нагрузка SemiAnalysis AgentX, которая основана на реальных сессиях программирования агентов. В ней сохранены длина запросов, рост контекста, паузы при использовании инструментов, зависимости подзадач и временная последовательность. Средний объём входного контекста в тесте превысил 140 тысяч токенов. Это означает переход от статического prompt к динамическим задачам.

Dion Harris, старший директор по решениям для высокопроизводительных вычислений и ИИ в Nvidia, отметил, что традиционные эталоны вывода ориентированы на единичные предсказуемые запросы, а агентные задачи включают несколько этапов с меняющейся нагрузкой. В случае рекурсивных многоэтапных агентных задач объём контекста, который нужно обработать на этапе Prefill, растёт с каждой итерацией — поэтому нужно учитывать входные данные в размере десятков тысяч токенов.

AgentX тестирует работу инфраструктуры сервисов вывода при агентном трафике, а не качество выполнения агентных задач. Nvidia размещает два показателя на одной кривой производительности: по оси X — количество токенов, получаемых одним пользователем в секунду (скорость взаимодействия), по оси Y — количество токенов, обрабатываемых системой при фиксированном энергобюджете (на мегаватт).

Groq 3 LPX уже запущен в массовое производство. По данным Artificial Analysis, при нагрузке Gemma 4 31B и контексте в 100 тысяч токенов скорость вывода Groq 3 LPX достигает 3400 токенов в секунду — это в 4 раза быстрее ближайших альтернатив. LPX нацелен на снижение задержек при генерации токенов.

Возможны разные схемы распределения задач между Vera Rubin NVL72 и LPX:
* Vera Rubin NVL72 обрабатывает входной контекст и генерирует KV Cache, LPX участвует в этапе Decode для генерации с низкой задержкой;
* Rubin отвечает за вычисления Attention и хранение KV Cache, LPX — за вычисления FFN;
* LPX запускает небольшую draft model для предварительного генерирования кандидатов в токены, а большая модель на Rubin их проверяет (предполагаемый декодинг).

Логика во всех схемах одинакова: внутренние задачи вывода разбиваются на разные типы вычислений, которые выполняются на наиболее подходящих процессорах. Nvidia утверждает, что Groq 3 LPX расширяет возможности платформы Vera Rubin для поддержки интерактивных агентских нагрузок ИИ.

Harris считает, что нужно выбирать подходящие процессоры для разных частей рабочей нагрузки. Rubin GPU обеспечивает гибкую пропускную способность и интерактивность, охватывая широкий спектр рабочих нагрузок. LPX ориентирован на сценарии с очень низкой задержкой. В системе Vera Rubin разные цели производительности разделяются: GPU продолжает выполнять широкий спектр модельных вычислений, а специализированные ускорители устраняют узкие места, например связанные с задержкой генерации токенов.

Agent увеличивает нагрузку на CPU между вызовами моделей — требуется участие CPU для оркестровки инструментов, выполнения кода, обработки данных и моделирования. Vera CPU выполняет задачи между вызовами моделей, а не сами модельные вычисления.

Изменения затрагивают и сетевой уровень: при взаимодействии пользователя, Agent, приложений, источников данных и сервисов хранения система сталкивается с более сложными сценариями обмена данными, чем просто обмен между GPU.

NVIDIA предлагает Scale-In для работы с трафиком в традиционных центрах обработки данных: BlueField-4 и DOCA выполняют задачи по сети, доступу к хранилищу, безопасности, управлению плоскостью и наблюдаемости, а Spectrum-X интегрирует всё в вычислительную инфраструктуру.

Spectrum-X Multiplane решает проблему масштабирования и восстановления после сбоев в крупных GPU-кластерах: использует несколько независимых сетевых плоскостей и обеспечивает аппаратное перенаправление при сбое пути. По данным NVIDIA, архитектура может масштабироваться до 51,2 тысячи GPU; в восьмиплоскостной топологии при отказе одной плоскости сохраняется около 90 % общей пропускной способности, скорость восстановления после сбоев в 11 раз выше, чем у программных решений.

Scale-In решает задачи соединения и управления между вычислительной системой и данными, хранилищем и сервисами инфраструктуры, а Spectrum-X Multiplane — проблемы масштабирования сети и восстановления после сбоев в крупных GPU-кластерах.

Демонстрация Nvidia ориентирована на высокую параллельность, длинный контекст и масштабное развёртывание. Реальный рынок будет зависеть от нагрузки, создаваемой приложениями Agent, и от того, принесут ли сложные гетерогенные системы достаточный прирост производительности. По логике архитектуры, представленной Nvidia на Hot Chips, GPU остаётся ядром вычислений ИИ. При этом при выполнении задачи Agent (обработка контекста, генерация Token, выполнение инструментов, передача данных) объектом оптимизации в следующей генерации инфраструктуры вывода становится не отдельный чип, а вся цепочка задач.

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK