141 гигабайт HBM3e на одной PCIe-карте, 4,8 ТБ/с пропускной способности и вычислительный кристалл, который не менялся со времён H100. Весь прирост H200 NVL идёт от памяти, и именно это определяет, кому карта даёт троекратное ускорение, а кому ноль. Показываем, где проходит граница.

Коротко

  • 141 ГБ и 4 813 ГБ/с против 94 ГБ и 3 938 ГБ/с у H100 NVL: объём больше в 1,5 раза, скорость в 1,2
  • Вычисления одинаковы до последнего TFLOPS: FP8 3 341, boost 1 785 МГц у обеих карт
  • Прирост на инференсе гуляет от 0% до 3,4 раза, решает длина контекста
  • Один мост NVLink на 900 ГБ/с связывает до четырёх карт в пул 564 ГБ, у H100 NVL было 188 ГБ на пару
  • 600 Вт на карту, пассивный радиатор, рабочие 10-45 °C против 0-50 °C у предшественницы

Что изменилось, а что осталось прежним

Если положить рядом страницы H200 и H100 на сайте NVIDIA, видно вещь, о которой в анонсах не говорят: колонки вычислительной производительности NVL-версий совпадают полностью. Тридцать терафлопс FP64, 835 TF32, 3 341 FP8. Одинаковый boost. Кремний тот же.

Параметр H200 NVL H100 NVL
Память 141 ГБ HBM3e 94 ГБ HBM3
Пропускная способность 4 813 ГБ/с 3 938 ГБ/с
Шина памяти 6 016 бит 6 016 бит
FP8 Tensor Core 3 341 TFLOPS 3 341 TFLOPS
TDP по умолчанию 600 Вт 400 Вт
NVLink 900 ГБ/с, до 4 карт 600 ГБ/с, только 2 карты

Тензорные ядра со structured sparsity. Источники: страница H200, страница H100, H100 NVL Product Brief, Product Brief H200 NVL PB-12128-001

Шина у обеих NVL шире, чем у H100 SXM: 6 016 бит против 5 120, потому что задействованы все шесть стеков HBM вместо пяти (разбор ServeTheHome). Поэтому даже старая H100 NVL быстрее по памяти, чем H100 SXM: 3,9 против 3,35 ТБ/с.

Что помещается в 141 гигабайт

Память делят между собой веса модели и KV-кеш, то есть «память разговора» каждого активного запроса. Веса это примерно байт на параметр в 8-битной точности и два байта в 16-битной. Кеш для Llama 3.1 8B в BF16 занимает около 512 МБ на запрос с контекстом 4 096 токенов (расчёт RunPod), и это число умножается на количество пользователей.

Модель Веса Одна H200 NVL
70B в FP8 около 70 ГБ да, ещё около 65 ГБ на кеш
70B в BF16 около 140 ГБ впритык, на кеш не остаётся
123B в FP8 около 123 ГБ влезает, под батчи нужна пара
405B в FP8 около 405 ГБ нет, нужна четвёрка на 564 ГБ

Объём весов это оценка по правилу байта на параметр. Пул 564 ГБ в четвёрке из референсной архитектуры NVIDIA

Главная ценность 141 ГБ именно здесь: модель класса 70B в FP8 живёт на одной карте вместе с запасом контекста, без тензорного параллелизма.

Сколько на самом деле даёт прирост

Одной цифры тут не существует. Замеры разбросаны от нуля до 3,4 раза по простому правилу: чем сильнее задача упирается в память, тем больше выигрыш.

Сценарий Прирост над H100 Кто мерил
Короткий контекст: чат, автодополнение кода 0% в BF16, +11% в FP8 Baseten
Llama 2 70B при одинаковой мощности 700 Вт +28% MLPerf, заявка NVIDIA
Батч 4 096 на последовательностях 2К +36% в FP8, +47% в BF16 Baseten
Контекст 32 784 токена, батч 64 3,4 раза Baseten

Источники: Baseten, 8×H200 против 8×H100, блог NVIDIA про MLPerf, сноски страницы H200

Теперь про самые громкие цифры. «1,9 раза на Llama 2 70B» получено при разных размерах батча: у H100 восемь, у H200 тридцать два. Больший батч возможен как раз благодаря памяти, поэтому цифра честная. Но она не про одинаковую нагрузку: если задача влезает в H100 с тем же батчем, прироста не будет.

«110 раз» на HPC-задаче MILC сравнивает четыре GPU с парой процессоров Sapphire Rapids 8480, а не с H100. Сравнение с H100 NVL сама NVIDIA даёт куда скромнее: до 1,3 раза на HPC. И ещё одно признание NVIDIA, которое редко цитируют: после оптимизаций TensorRT-LLM «выполнение Llama 2 70B на H200 ограничено вычислениями, а не пропускной способностью памяти». Отсюда и потолок.

NVL и SXM: разница не в памяти

SXM это модуль на базовой плате HGX, который покупают вместе с сервером. NVL это PCIe-карта двойной толщины под стандартный слот. Память у них одинаковая.

Параметр H200 NVL H200 SXM
FP8 Tensor Core 3 341 TFLOPS 3 958 TFLOPS
TDP до 600 Вт до 700 Вт
GPU в одном домене NVLink до 4 через мост 4 или 8 через плату HGX
NVIDIA AI Enterprise включено на 5 лет докупается отдельно

Источники: таблица спецификаций NVIDIA, даташит PNY

Плата за форм-фактор составляет 15,6% вычислений и 100 Вт бюджета. Важнее другое ограничение. В сервере на восемь H200 NVL вы получаете две независимые четвёрки, а не один домен: между ними данные идут через PCIe Gen5 на 128 ГБ/с, всемеро медленнее NVLink. Для инференса модели до 564 ГБ это безразлично, для тренировки на все восемь карт уже нет.

Мостик NVLink и почему карт максимум четыре

В H100 NVL стояло три узких моста на карту, те же, что в A100 PCIe, и связать можно было ровно две. H200 NVL использует один широкий мост на 18 линий: двухслотовый даёт 900 ГБ/с, четырёхслотовый 1 800 ГБ/с. Мосты поколений несовместимы, при апгрейде парка старые планки придётся выбросить.

Паспортные 900 ГБ/с это двунаправленная сумма. Для пары H200 NVL, собранной в HPE DL385 Gen11 под Proxmox VE 8.4, на форуме Proxmox опубликован вывод nvidia-smi: все 18 линий активны по 26,562 ГБ/с, то есть около 478 ГБ/с на GPU в одну сторону. Заодно доказательство, что NVLink выживает при пробросе карты в виртуалку, хотя официально Proxmox такого не обещает.

Требования к топологии читают ещё на этапе спецификации: мостить надо карты под одним процессором, количество GPU рекомендовано степенью двойки, а над кромкой карты нужно оставить 2,5 мм зазора.

Чего карта хочет от сервера

Требование Значение
Слот PCIe Gen5 x16, полная высота и длина 10,5", два слота
Питание один разъём 16-pin 12VHPWR, до 600 Вт
Охлаждение пассивный радиатор, обдув обеспечивает шасси
Температура среды 10-45 °C, у H100 NVL было 0-50 °C
Софт драйвер R565 TRD1, CUDA 12.7, vGPU 18.1 и новее

Источники: Product Brief NVIDIA H200 NVL PB-12128-001, Lenovo Press lp1944, даташит PNY

Две строки таблицы стоят отдельного внимания. Первая очевидна: 600 Вт вместо 400 Вт, в четырёхкарточной сборке это лишних 800 Вт на шасси. Вторую замечают реже. Допустимая среда сузилась с обеих сторон: низ поднялся с нуля до 10 °C, верх опустился с 50 до 45 °C. Карта потребляет больше, а коридор имеет уже. Стойка, в которой жили H100 NVL, под H200 NVL подходит не автоматически.

По нижней границе мощности источники расходятся: по брифу аппаратный минимум 200 Вт, а Dell продаёт карту как «450W-600W». С совместимостью так же: Lenovo берёт до восьми карт в ThinkSystem SR675 V3 и до двух в SR650a V4, причём всё зависит от machine type. Проверяют не название сервера, а SKU.

MIG, vGPU и лицензия в комплекте

Карта делится на семь изолированных инстансов, и тут NVIDIA сама себе противоречит. Страница продукта говорит «до 7 MIG по 16,5 ГБ», а документация MIG перечисляет профиль 1g.18gb в семи экземплярах. Ориентируйтесь на документацию, потому что именно её читает драйвер.

О виртуализации есть деталь, которой нет в маркетинговых материалах. Для H200 NVL на Proxmox VE 9.0.3 с драйвером 570.195.02-vgpu-kvm на форуме NVIDIA симптомы описаны дословно: сервис nvidia-vgpu-mgr падает с ошибкой 0x59, каталогов mdev нет. Работает только SR-IOV. Приятное: пятилетняя подписка NVIDIA AI Enterprise уже входит в цену NVL-карты, для SXM её покупают отдельно.

Кому этой карты слишком много

Самую честную формулировку дала команда Baseten: «вне этих сценариев мы видели минимальный прирост H200 над H100». А поскольку час H200 стоит дороже, добавляют они, немало задач инференса выходят дешевле на H100.

Переплата не работает в четырёх случаях. Модель помещается в 94 ГБ: вы платите за память, которой не пользуетесь. Запросы короткие, батчи мелкие, контекст в пределах пары тысяч токенов: прирост близок к нулю. Стойка не держит 600 Вт на слот или не вытягивает температуру ниже 45 °C. И последнее: вам нужна тренировка на восьми связанных GPU, а не инференс.

Зеркальная сторона. Карта окупается на моделях от ста миллиардов параметров, на контекстах в десятки тысяч токенов и там, где 141 ГБ позволяет обойтись одной картой вместо двух.

Что из этого есть у нас

Частые вопросы

Работает ли vGPU через mdev на H200 NVL?

Нет. Доступен только режим SR-IOV, 32 виртуальные функции. Вопрос про 56 MIG-профилей на восьми GPU в KVM без AI Enterprise на форуме NVIDIA остался без ответа.

Нужен ли коммутатор, чтобы соединить два сервера с H200 NVL?

По ответу модератора форума NVIDIA, нет: два адаптера ConnectX-7 соединяются напрямую. Ловушка в другом. Если карты и адаптер окажутся в разных NUMA-узлах, трафик пойдёт через процессоры.

Работает ли одна карта H100 NVL без пары?

Да. ServeTheHome публиковал об этом отдельный материал, потому что в сети много описаний «188 ГБ». Эти 188 ГБ это две карты по 94.

Насколько H200 NVL быстрее H100 NVL на самом деле?

NVIDIA заявляет до 1,7 раза на LLM-инференсе и до 1,3 раза на HPC, но условий этих измерений не опубликовала. Независимые замеры дают от 0% до 3,4 раза, и результат определяет длина контекста.

Посчитать, нужны ли вам именно 141 ГБ?

Назовите модель, длину контекста, количество одновременных запросов и марку сервера. Наши инженеры скажут, хватит ли одной карты.

Получить консультацию

Автор: Инженер ETE