H200 NVL и H100 NVL построены на одном и том же вычислительном кремнии: те же 835 TFLOPS в TF32, те же 3341 в FP8, тот же boost 1785 МГц. Вся разница между ними в памяти. Поэтому вопрос не в том, какая карта быстрее, а в том, упирается ли ваша нагрузка именно в память. Если нет, доплата не покупает ничего.

Коротко

  • Вычислительные характеристики идентичны во всех точностях, от FP64 до INT8
  • Памяти у H200 NVL в 1,5 раза больше (141 ГБ против 94), пропускной способности в 1,22 раза (4813 против 3938 ГБ/с)
  • Прирост на реальных задачах гуляет от 0% до 3,4х: ноль на коротком контексте в BF16, 3,4х на входе в 32 тысячи токенов
  • MLPerf при одинаковых 700 Вт даёт +28% на Llama 2 70B, а не заявленные 90%
  • H200 NVL мостится по четыре карты (564 ГБ), H100 NVL только по две (188 ГБ)

Сначала то, что ломает большинство сравнений

Положите рядом таблицы спецификаций со страниц NVIDIA, и увидите вещь, о которой в обзорах вспоминают редко. Вычислительная часть двух карт совпадает до последней цифры. Не примерно, а точно.

Точность H200 NVL H100 NVL
FP64 30 TFLOPS 30 TFLOPS
FP32 60 TFLOPS 60 TFLOPS
TF32 Tensor Core 835 TFLOPS 835 TFLOPS
BF16 и FP16 Tensor Core 1671 TFLOPS 1671 TFLOPS
FP8 и INT8 Tensor Core 3341 TFLOPS 3341 TFLOPS
Частота boost 1785 МГц 1785 МГц

Значения тензорных ядер со structured sparsity, как в сноске NVIDIA. Источники: страница H200, страница H100

Следствие простое. Если задача упирается в математику, карты отработают одинаково. Это не догадка: в отчёте о рекордах MLPerf NVIDIA пишет, что после оптимизаций TensorRT-LLM выполнение Llama 2 70B на H200 ограничивается вычислениями, а не пропускной способностью памяти.

Вся разница живёт в памяти

Параметр H200 NVL H100 NVL
Объём 141 ГБ 94 ГБ
Тип HBM3e HBM3
Пропускная способность 4813 ГБ/с 3938 ГБ/с
Частота памяти 3201 МГц 2619 МГц
Шина 6016 бит 6016 бит
Профили MIG до 7 по 1g.18gb до 7 по 1g.12gb

Источники: Product Brief H200 NVL, Product Brief H100 NVL, справочник профилей MIG. Размер инстанса расходится у самой NVIDIA: страница продукта даёт 16,5 ГБ, документация 18

У обеих NVL-карт шина шире, чем у H100 SXM: задействовано шесть стеков HBM вместо пяти, поэтому даже старая H100 NVL выдаёт 3,9 ТБ/с против 3,35 у SXM. Это разобрал ServeTheHome. Почему объём равен 94 ГБ, а не круглым 96, NVIDIA не объясняет нигде.

Сколько это даёт на конкретных задачах

Одну цифру назвать невозможно. Разброс от нуля до 3,4 раза, в зависимости от того, насколько задача упирается в память.

Сценарий Прирост Кто мерил
Короткий контекст, 128 токенов, BF16 около 0% Baseten
То же самое в FP8 +11% Baseten
Llama 2 70B, одинаковые 700 Вт +28% MLPerf
Батч 4096, FP8 +36% Baseten
Батч 4096, BF16 +47% Baseten
Пакет HPC-приложений, заявка для NVL до 1,3х NVIDIA
Вход 32 784 токена, батч 64 3,4х Baseten

Baseten мерил на кластерах 8×H200 против 8×H100 в форм-факторе SXM, так что на NVL соотношение перенесено с оговоркой. Источники: Baseten, блог NVIDIA про MLPerf, сноски на странице H200

Вывод Baseten резче любого слогана: «вне этих ситуаций H200 даёт минимальный прирост над H100, и многие задачи инференса выгоднее на H100». Для пары NVL сама NVIDIA обещает до 1,7х на языковых моделях и до 1,3х на HPC, но условий этого теста не публикует вовсе.

Как читать цифры из презентаций

Самая громкая цифра в материалах про H200 это «110X на HPC». В сноске написано, с чем сравнивали: четыре GPU против пары процессоров Sapphire Rapids 8480. То есть это сравнение с CPU. Против H100 на том же наборе задач NVIDIA общей цифры не приводит: в сноске только перечень приложений и сравнение одной H100 SXM с одной H200 SXM.

Вторая цифра это 1,9х на Llama 2 70B. Сноска NVIDIA раскрывает условия: H100 работала с батчем 8, H200 с батчем 32. Это не подтасовка, потому что больший батч возможен именно благодаря большей памяти, в этом и смысл продукта. Но 1,9х не означает, что та же нагрузка выполнится вдвое быстрее. Это значит, что карта вытянет конфигурацию, которую предшественница не тянет. Если ваша модель уже помещается в 94 ГБ с нужным батчем, такого прироста не будет.

NVLink: здесь разница между поколениями самая большая

Параметр H200 NVL H100 NVL
Карт в группе до 4 только 2
Память группы 564 ГБ 188 ГБ
Пропускная способность NVLink 900 ГБ/с 600 ГБ/с
Мостов на карту 1 широкий, отдельные для 2 и 4 карт 3 узких, те же, что в A100 PCIe

Мосты двух поколений между собой несовместимы. Источники: Product Brief H200 NVL, Product Brief H100 NVL, референсная архитектура NVIDIA

Паспортные 900 ГБ/с считаются в обе стороны. В ветке про две H200 NVL в HPE DL385 Gen11 выложили вывод nvidia-smi: 18 активных линий по 26,562 ГБ/с, около 478 ГБ/с на GPU в одну сторону. Арифметика сходится. А карты вне общей мостовой группы общаются через PCIe Gen5 на 128 ГБ/с, примерно всемеро медленнее.

Что ещё меняется, кроме скорости

Замена карты в стойке не всегда проходит безболезненно. Вот конкретика, которой нет в таблицах облачных провайдеров.

Параметр H200 NVL H100 NVL
Мощность по умолчанию 600 Вт 400 Вт
Рабочая температура среды 10-45 °C 0-50 °C
Минимальный драйвер R565 TRD1, CUDA 12.7 R535, CUDA 12.2
UEFI поддерживается не поддерживается
Лицензия NVIDIA AI Enterprise 5 лет в комплекте 5 лет в комплекте

Источники: Product Brief обеих карт, анонс H200 NVL на SC24. Dell продаёт H200 NVL как карту 450-600 Вт, хотя аппаратный минимум в Product Brief составляет 200 Вт

Обратите внимание на вторую строку. Новая карта потребляет на 200 Вт больше, а допустимый диапазон температуры у неё уже с обеих сторон. Для машинного зала это мелочь. Для серверной комнаты в офисе, которая летом прогревается выше 45 градусов, это причина не покупать. Плюс электричество: 200 Вт разницы при круглосуточной работе дают 1752 кВт·ч на карту за год.

Когда переплата окупается, а когда хватает H100 NVL

Правило считается в одно действие. Доплата оправдана тогда, когда прирост на вашем профиле нагрузки в процентах превышает разницу в цене в процентах. Карта дороже на 40%, а у вас чат с короткими запросами и прирост 11%? Каждый токен выйдет дороже, чем на H100 NVL. Если же вы гоняете документы по 30 тысяч токенов пачками, прирост в 3,4 раза перекроет надбавку за полгода.

Второй расчёт важнее, и его почти нигде не делают. Сравнивать надо не карту с картой, а конфигурацию с конфигурацией.

Нужно памяти под модель и KV-кеш Что это значит на практике
до 94 ГБ одна H100 NVL. Доплата покупает память, которой вы не пользуетесь
94-141 ГБ одна H200 NVL или пара H100 NVL с мостом. Одна карта это один слот вместо двух и 600 Вт вместо 800
141-188 ГБ пара H100 NVL с мостом даёт 188 ГБ
больше 188 ГБ только H200 NVL: пара даёт 282 ГБ, четвёрка 564 ГБ. Группы H100 NVL больше двух карт не бывает

Производный расчёт по паспортным объёмам и максимальному размеру мостовой группы из Product Brief обеих карт

Теперь о том, зачем покупать, когда рядом есть облако. Аренда выигрывает на пиковых и разовых задачах, тут спорить не с чем. Но с обеими NVL-картами идёт пятилетняя лицензия NVIDIA AI Enterprise, а для SXM её докупают отдельно. Данные остаются в периметре, и для медицинских, финансовых и государственных проектов это вопрос допуска, а не денег. И отдельно: Hopper сворачивается, часть серверных платформ с этими GPU уже закрыла приём заказов.

Что из этого есть у нас

Частые вопросы

Работает ли H100 NVL на 94 ГБ как одиночная карта, без моста?

Да. Вопрос возникает постоянно, потому что карту долго показывали исключительно парами на 188 ГБ. ServeTheHome выпустил отдельный материал со словами «кажется почти нелепым это публиковать, но онлайн столько источников показывают их только парами, что мы решили внести ясность».

Подойдёт ли к H200 NVL мост от H100 NVL?

Нет. H100 NVL использует три узких моста, те же, что в A100 PCIe. У H200 NVL один широкий мост нового типа, с отдельными артикулами для группы из двух и из четырёх карт. При обновлении парка мосты покупаются заново.

Заработает ли MIG в KVM-виртуализации без AI Enterprise? Можно ли поднять 56 профилей 1g.18gb на сервере с восемью GPU?

Вопрос задали на форуме разработчиков NVIDIA и ответа от компании так и не получили. Арифметика 7×8 сходится, профиль 1g.18gb в документации есть. Но «сходится на бумаге» и «валидировано вендором» это разные вещи.

Поддерживается ли vGPU через mdev на H200?

По опыту владельцев на Proxmox VE 9 доступен только SR-IOV: каталогов mdev_bus и mdev_supported_types нет, а nvidia-vgpu-mgr падает с ошибкой привязки устройства. Со стороны NVIDIA на форуме добавили, что KVM на базе Proxmox пока не входит в поддерживаемые платформы AI Enterprise.

Нужен ли коммутатор InfiniBand, чтобы соединить два сервера с H200 NVL?

На форуме NVIDIA на такую же конфигурацию (два GPU в одном сервере и четыре во втором) ответили прямо: коммутатор не обязателен, достаточно соединить адаптеры ConnectX-7 напрямую. Ловушка в другом. Если GPU и сетевая карта окажутся в разных узлах NUMA, трафик пойдёт через процессор.

Работает ли NVLink внутри виртуальной машины?

Есть задокументированный случай: две H200 NVL в HPE DL385 Gen11, Proxmox VE 8.4, проброс VFIO, гость Ubuntu, драйвер 580.95.05. Все 18 линий активны внутри виртуалки. В записи честно отмечено, что Proxmox поддержку NVLink в VM официально не заявляет. Конфигурация рабочая, но вне гарантированного сценария.

Посчитаем, что нужно именно вам

Назовите модель, длину контекста и сколько одновременных запросов планируется. Посчитаем нужный объём памяти, скажем, хватит одной карты или нужна мостовая группа, и проверим совместимость с вашей платформой.

Получить консультацию