DeepDigest
Leiphone · · ~5 мин

NVIDIA: эффективность H100 зависит от проектирования модели

NVIDIA указывает на проблему неэффективного использования топовых GPU из‑за неправильного проектирования моделей. Эффективность работы оборудования зависит от алгебраической интенсивности — отношения числа вычислений к объёму переданных данных. Компания представила 7 критериев проектирования моделей, дружественного к пропускной способности.

LLM
NVIDIA: эффективность H100 зависит от проектирования модели

Компания NVIDIA обратила внимание на проблему неэффективного использования топовых GPU — например, карт H100. Как отмечает автор Гао Юньи в материале от 23 июля 2026 года, даже при вложении нескольких миллионов в размещение модели на 8 картах H100 использование GPU остаётся на уровне около 40%. Причина не в недостатке вычислительной мощности, а в том, что модель изначально не спроектирована для эффективной работы с GPU.

В техническом блоге «AI Model Co-Design: Hardware-Friendly LLM Design» NVIDIA подчёркивает: чтобы GPU работал максимально эффективно, нужно учитывать особенности оборудования при проектировании моделей. Вычислительная мощность GPU впечатляет — десятки квадриллионов операций с плавающей запятой в секунду. Но его эффективность зависит от того, насколько хорошо данные (модельные веса, входные признаки) подаются из видеопамяти в вычислительные ядра.

Ключевое понятие здесь — «алгебраическая интенсивность» (arithmetic intensity). Это отношение общего количества вычислений, выполненных видеокартой, к общему объёму переданных ею данных в байтах. Оно показывает, сколько вычислительных операций GPU выполняет на каждый переданный байт данных. При низкой алгебраической интенсивности GPU 90% времени ждёт операций чтения/записи данных — это проблема «ограничения доступа к памяти» (memory-bound).

Один из примеров неэффективного использования оборудования — FFN-2 (второй слой прямой нейронной сети в больших моделях). В стандартных вычислениях матричного умножения в этом слое участвуют три основных измерения: M (общее количество токенов на входе), N (скрытое измерение), K (промежуточное измерение). В анализируемом случае N = 8192, K = 512. Анализ для оборудования GB300 (15 PFLOPS FP4, пропускная способность 8 TB/s) показал, что время передачи данных из видеопамяти превышает время вычислений — слой ограничен пропускной способностью видеопамяти независимо от количества токенов. Проблема в малом значении K (512): общее количество вычислений слишком мало по сравнению с объёмом переданных данных. Использование низкоточного формата в больших моделях для ускорения обработки усугубляет проблему — скорость передачи данных не успевает за скоростью вычислений.

В тестах на чипе GB300 от NVIDIA при M=8192 для достижения 80% пропускной способности K должно быть >3072, а для полной загрузки видеокарты — 6144. NVIDIA пришла к выводу, что иногда память является более серьёзным узким местом, чем GPU, особенно при низкой арифметической интенсивности.

Производительность в реальном AI‑проекте ограничена тремя параметрами:
* точность — корректность ответов модели;
* пропускная способность — количество токенов, выводимых сервером в секунду (определяет число одновременных пользователей и операционные затраты);
* интерактивность — субъективное восприятие пользователя (включает начальную задержку и задержку между символами).

Пропускная способность и интерактивность противоречат друг другу: стремление к высокой пропускной способности ведёт к пакетной обработке запросов и увеличению задержек, а фокус на интерактивности — к росту затрат из‑за недозагрузки GPU.

Для решения проблемы нужно реализовать совместное проектирование модели и оборудования. Ключевые аспекты проектирования:
* точно определить границы производительности видеокарты, избегать структур, которые переводят видеокарту в режим ожидания данных;
* соответствовать параметрам вычислений базового оборудования (размеры плиток 128/256/512), избегать нестандартных размеров вроде «333»;
* использовать низкоточную арифметику (например, поддержку NVFP4 в Blackwell);
* учитывать топологию сети — заранее нарезать блоки данных в соответствии с распределением кабелей в кластере видеокарт.

NVIDIA представила 7 критериев проектирования, дружественного к пропускной способности:
1. Избегать «деформированных узких матриц» (например, размера 512) — при неизменном общем числе параметров промежуточные измерения не должны быть слишком узкими, иначе вырастет объём переноса данных и видеокарта попадёт в ловушку ограничений, связанных с переносом данных в память.
2. Размеры модели должны быть кратны 128/256/512 для строгого выравнивания с размером GPU Tile.
3. При проектировании структуры модели нужно учитывать поддержку NVFP4 (4‑битная квантизация с плавающей точкой). GB300 (Blackwell) имеет специальный вычислительный канал NVFP4: пиковая производительность NVFP4 в 3 раза выше, чем у FP8, и в 6 раз выше, чем у FP16. DeepSeek‑R1 подтвердил: после квантования с NVFP4 большинство результатов тестов отличаются от высокоточных версий не более чем на 1 %, в некоторых математических и кодовых задачах наблюдается превосходство.
4. При одинаковом количестве параметров предпочтительны широкие модели, а не глубокие: нужно уменьшать количество слоёв и увеличивать ширину каждого слоя.
5. В сценариях с высокой пропускной способностью и массовым параллелизмом для больших моделей MoE вместо традиционного тензорного параллелизма (TP) следует использовать расширенный экспертный параллелизм (Wide‑EP) — распределять разных «экспертов» по разным GPU. Для сверхбольших моделей можно применять смешанный параллелизм EP×TP.
6. Структура модели должна быть унифицированной и упорядоченной — это позволит эффективно использовать блочный конвейерный параллелизм (CPP), быстро разбивать длинные тексты и минимизировать задержки при первом ответе.
7. В сценариях с крайне низкой задержкой не следует объединять механизм внимания (Attention) и сеть прямой связи (FFN) в одну стратегию параллелизма. Для Attention рекомендуется использовать архитектуру Helix для разделения размерности последовательности и использовать высокую пропускную способность NVLink для сокращения времени коммуникации. Готовые решения для сложных стратегий параллелизма доступны в TensorRT Model Optimizer и TensorRT‑LLM.

ROI при покупке карт зависит не только от параметров вычислительной мощности, но и от «формы матрицы» вашей модели. Неправильная форма приводит к тому, что даже затраты в десятки миллионов на карты лишь незначительно отодвинут «стену памяти». Экономия и повышение эффективности достигаются не только при подписании крупных заказов на вычислительные мощности, но и при правильных решениях в деталях проектирования.

Ссылка:

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

// оригинал
Leiphone ↗ Читать оригинал
6 просмотров
// поделиться Telegram VK