141 гигабайт HBM3e на одной PCIe-карте, 4,8 ТБ/с пропускной способности и вычислительный кристалл, который не менялся со времён H100. Весь прирост H200 NVL идёт от памяти, и именно это определяет, кому карта даёт троекратное ускорение, а кому ноль. Показываем, где проходит граница.
Коротко
- 141 ГБ и 4 813 ГБ/с против 94 ГБ и 3 938 ГБ/с у H100 NVL: объём больше в 1,5 раза, скорость в 1,2
- Вычисления одинаковы до последнего TFLOPS: FP8 3 341, boost 1 785 МГц у обеих карт
- Прирост на инференсе гуляет от 0% до 3,4 раза, решает длина контекста
- Один мост NVLink на 900 ГБ/с связывает до четырёх карт в пул 564 ГБ, у H100 NVL было 188 ГБ на пару
- 600 Вт на карту, пассивный радиатор, рабочие 10-45 °C против 0-50 °C у предшественницы
Что изменилось, а что осталось прежним
Если положить рядом страницы H200 и H100 на сайте NVIDIA, видно вещь, о которой в анонсах не говорят: колонки вычислительной производительности NVL-версий совпадают полностью. Тридцать терафлопс FP64, 835 TF32, 3 341 FP8. Одинаковый boost. Кремний тот же.
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Память | 141 ГБ HBM3e | 94 ГБ HBM3 |
| Пропускная способность | 4 813 ГБ/с | 3 938 ГБ/с |
| Шина памяти | 6 016 бит | 6 016 бит |
| FP8 Tensor Core | 3 341 TFLOPS | 3 341 TFLOPS |
| TDP по умолчанию | 600 Вт | 400 Вт |
| NVLink | 900 ГБ/с, до 4 карт | 600 ГБ/с, только 2 карты |
Тензорные ядра со structured sparsity. Источники: страница H200, страница H100, H100 NVL Product Brief, Product Brief H200 NVL PB-12128-001
Шина у обеих NVL шире, чем у H100 SXM: 6 016 бит против 5 120, потому что задействованы все шесть стеков HBM вместо пяти (разбор ServeTheHome). Поэтому даже старая H100 NVL быстрее по памяти, чем H100 SXM: 3,9 против 3,35 ТБ/с.
Что помещается в 141 гигабайт
Память делят между собой веса модели и KV-кеш, то есть «память разговора» каждого активного запроса. Веса это примерно байт на параметр в 8-битной точности и два байта в 16-битной. Кеш для Llama 3.1 8B в BF16 занимает около 512 МБ на запрос с контекстом 4 096 токенов (расчёт RunPod), и это число умножается на количество пользователей.
| Модель | Веса | Одна H200 NVL |
|---|---|---|
| 70B в FP8 | около 70 ГБ | да, ещё около 65 ГБ на кеш |
| 70B в BF16 | около 140 ГБ | впритык, на кеш не остаётся |
| 123B в FP8 | около 123 ГБ | влезает, под батчи нужна пара |
| 405B в FP8 | около 405 ГБ | нет, нужна четвёрка на 564 ГБ |
Объём весов это оценка по правилу байта на параметр. Пул 564 ГБ в четвёрке из референсной архитектуры NVIDIA
Главная ценность 141 ГБ именно здесь: модель класса 70B в FP8 живёт на одной карте вместе с запасом контекста, без тензорного параллелизма.
Сколько на самом деле даёт прирост
Одной цифры тут не существует. Замеры разбросаны от нуля до 3,4 раза по простому правилу: чем сильнее задача упирается в память, тем больше выигрыш.
| Сценарий | Прирост над H100 | Кто мерил |
|---|---|---|
| Короткий контекст: чат, автодополнение кода | 0% в BF16, +11% в FP8 | Baseten |
| Llama 2 70B при одинаковой мощности 700 Вт | +28% | MLPerf, заявка NVIDIA |
| Батч 4 096 на последовательностях 2К | +36% в FP8, +47% в BF16 | Baseten |
| Контекст 32 784 токена, батч 64 | 3,4 раза | Baseten |
Источники: Baseten, 8×H200 против 8×H100, блог NVIDIA про MLPerf, сноски страницы H200
Теперь про самые громкие цифры. «1,9 раза на Llama 2 70B» получено при разных размерах батча: у H100 восемь, у H200 тридцать два. Больший батч возможен как раз благодаря памяти, поэтому цифра честная. Но она не про одинаковую нагрузку: если задача влезает в H100 с тем же батчем, прироста не будет.
«110 раз» на HPC-задаче MILC сравнивает четыре GPU с парой процессоров Sapphire Rapids 8480, а не с H100. Сравнение с H100 NVL сама NVIDIA даёт куда скромнее: до 1,3 раза на HPC. И ещё одно признание NVIDIA, которое редко цитируют: после оптимизаций TensorRT-LLM «выполнение Llama 2 70B на H200 ограничено вычислениями, а не пропускной способностью памяти». Отсюда и потолок.
NVL и SXM: разница не в памяти
SXM это модуль на базовой плате HGX, который покупают вместе с сервером. NVL это PCIe-карта двойной толщины под стандартный слот. Память у них одинаковая.
| Параметр | H200 NVL | H200 SXM |
|---|---|---|
| FP8 Tensor Core | 3 341 TFLOPS | 3 958 TFLOPS |
| TDP | до 600 Вт | до 700 Вт |
| GPU в одном домене NVLink | до 4 через мост | 4 или 8 через плату HGX |
| NVIDIA AI Enterprise | включено на 5 лет | докупается отдельно |
Источники: таблица спецификаций NVIDIA, даташит PNY
Плата за форм-фактор составляет 15,6% вычислений и 100 Вт бюджета. Важнее другое ограничение. В сервере на восемь H200 NVL вы получаете две независимые четвёрки, а не один домен: между ними данные идут через PCIe Gen5 на 128 ГБ/с, всемеро медленнее NVLink. Для инференса модели до 564 ГБ это безразлично, для тренировки на все восемь карт уже нет.
Мостик NVLink и почему карт максимум четыре
В H100 NVL стояло три узких моста на карту, те же, что в A100 PCIe, и связать можно было ровно две. H200 NVL использует один широкий мост на 18 линий: двухслотовый даёт 900 ГБ/с, четырёхслотовый 1 800 ГБ/с. Мосты поколений несовместимы, при апгрейде парка старые планки придётся выбросить.
Паспортные 900 ГБ/с это двунаправленная сумма. Для пары H200 NVL, собранной в HPE DL385 Gen11 под Proxmox VE 8.4, на форуме Proxmox опубликован вывод nvidia-smi: все 18 линий активны по 26,562 ГБ/с, то есть около 478 ГБ/с на GPU в одну сторону. Заодно доказательство, что NVLink выживает при пробросе карты в виртуалку, хотя официально Proxmox такого не обещает.
Требования к топологии читают ещё на этапе спецификации: мостить надо карты под одним процессором, количество GPU рекомендовано степенью двойки, а над кромкой карты нужно оставить 2,5 мм зазора.
Чего карта хочет от сервера
| Требование | Значение |
|---|---|
| Слот | PCIe Gen5 x16, полная высота и длина 10,5", два слота |
| Питание | один разъём 16-pin 12VHPWR, до 600 Вт |
| Охлаждение | пассивный радиатор, обдув обеспечивает шасси |
| Температура среды | 10-45 °C, у H100 NVL было 0-50 °C |
| Софт | драйвер R565 TRD1, CUDA 12.7, vGPU 18.1 и новее |
Источники: Product Brief NVIDIA H200 NVL PB-12128-001, Lenovo Press lp1944, даташит PNY
Две строки таблицы стоят отдельного внимания. Первая очевидна: 600 Вт вместо 400 Вт, в четырёхкарточной сборке это лишних 800 Вт на шасси. Вторую замечают реже. Допустимая среда сузилась с обеих сторон: низ поднялся с нуля до 10 °C, верх опустился с 50 до 45 °C. Карта потребляет больше, а коридор имеет уже. Стойка, в которой жили H100 NVL, под H200 NVL подходит не автоматически.
По нижней границе мощности источники расходятся: по брифу аппаратный минимум 200 Вт, а Dell продаёт карту как «450W-600W». С совместимостью так же: Lenovo берёт до восьми карт в ThinkSystem SR675 V3 и до двух в SR650a V4, причём всё зависит от machine type. Проверяют не название сервера, а SKU.
MIG, vGPU и лицензия в комплекте
Карта делится на семь изолированных инстансов, и тут NVIDIA сама себе противоречит. Страница продукта говорит «до 7 MIG по 16,5 ГБ», а документация MIG перечисляет профиль 1g.18gb в семи экземплярах. Ориентируйтесь на документацию, потому что именно её читает драйвер.
О виртуализации есть деталь, которой нет в маркетинговых материалах. Для H200 NVL на Proxmox VE 9.0.3 с драйвером 570.195.02-vgpu-kvm на форуме NVIDIA симптомы описаны дословно: сервис nvidia-vgpu-mgr падает с ошибкой 0x59, каталогов mdev нет. Работает только SR-IOV. Приятное: пятилетняя подписка NVIDIA AI Enterprise уже входит в цену NVL-карты, для SXM её покупают отдельно.
Кому этой карты слишком много
Самую честную формулировку дала команда Baseten: «вне этих сценариев мы видели минимальный прирост H200 над H100». А поскольку час H200 стоит дороже, добавляют они, немало задач инференса выходят дешевле на H100.
Переплата не работает в четырёх случаях. Модель помещается в 94 ГБ: вы платите за память, которой не пользуетесь. Запросы короткие, батчи мелкие, контекст в пределах пары тысяч токенов: прирост близок к нулю. Стойка не держит 600 Вт на слот или не вытягивает температуру ниже 45 °C. И последнее: вам нужна тренировка на восьми связанных GPU, а не инференс.
Зеркальная сторона. Карта окупается на моделях от ста миллиардов параметров, на контекстах в десятки тысяч токенов и там, где 141 ГБ позволяет обойтись одной картой вместо двух.
Что из этого есть у нас
- Видеокарта PNY NVIDIA H200 NVL 141 ГБ HBM3E PCIe: розничная упаковка, TCSH200NVLPCIE-PB
- Та же карта в bulk-упаковке: TCSH200NVLPCIE-BLK, под интеграцию
- Видеокарта PNY NVIDIA H100 NVL 94 ГБ HBM3 PCIe: предыдущее поколение, сейчас под заказ
Частые вопросы
Работает ли vGPU через mdev на H200 NVL?
Нет. Доступен только режим SR-IOV, 32 виртуальные функции. Вопрос про 56 MIG-профилей на восьми GPU в KVM без AI Enterprise на форуме NVIDIA остался без ответа.
Нужен ли коммутатор, чтобы соединить два сервера с H200 NVL?
По ответу модератора форума NVIDIA, нет: два адаптера ConnectX-7 соединяются напрямую. Ловушка в другом. Если карты и адаптер окажутся в разных NUMA-узлах, трафик пойдёт через процессоры.
Работает ли одна карта H100 NVL без пары?
Да. ServeTheHome публиковал об этом отдельный материал, потому что в сети много описаний «188 ГБ». Эти 188 ГБ это две карты по 94.
Насколько H200 NVL быстрее H100 NVL на самом деле?
NVIDIA заявляет до 1,7 раза на LLM-инференсе и до 1,3 раза на HPC, но условий этих измерений не опубликовала. Независимые замеры дают от 0% до 3,4 раза, и результат определяет длина контекста.
Эти модели есть в каталоге
Посчитать, нужны ли вам именно 141 ГБ?
Назовите модель, длину контекста, количество одновременных запросов и марку сервера. Наши инженеры скажут, хватит ли одной карты.
Получить консультацию


