H200 NVL и H100 NVL построены на одном и том же вычислительном кремнии: те же 835 TFLOPS в TF32, те же 3341 в FP8, тот же boost 1785 МГц. Вся разница между ними в памяти. Поэтому вопрос не в том, какая карта быстрее, а в том, упирается ли ваша нагрузка именно в память. Если нет, доплата не покупает ничего.
Коротко
- Вычислительные характеристики идентичны во всех точностях, от FP64 до INT8
- Памяти у H200 NVL в 1,5 раза больше (141 ГБ против 94), пропускной способности в 1,22 раза (4813 против 3938 ГБ/с)
- Прирост на реальных задачах гуляет от 0% до 3,4х: ноль на коротком контексте в BF16, 3,4х на входе в 32 тысячи токенов
- MLPerf при одинаковых 700 Вт даёт +28% на Llama 2 70B, а не заявленные 90%
- H200 NVL мостится по четыре карты (564 ГБ), H100 NVL только по две (188 ГБ)
Сначала то, что ломает большинство сравнений
Положите рядом таблицы спецификаций со страниц NVIDIA, и увидите вещь, о которой в обзорах вспоминают редко. Вычислительная часть двух карт совпадает до последней цифры. Не примерно, а точно.
| Точность | H200 NVL | H100 NVL |
|---|---|---|
| FP64 | 30 TFLOPS | 30 TFLOPS |
| FP32 | 60 TFLOPS | 60 TFLOPS |
| TF32 Tensor Core | 835 TFLOPS | 835 TFLOPS |
| BF16 и FP16 Tensor Core | 1671 TFLOPS | 1671 TFLOPS |
| FP8 и INT8 Tensor Core | 3341 TFLOPS | 3341 TFLOPS |
| Частота boost | 1785 МГц | 1785 МГц |
Значения тензорных ядер со structured sparsity, как в сноске NVIDIA. Источники: страница H200, страница H100
Следствие простое. Если задача упирается в математику, карты отработают одинаково. Это не догадка: в отчёте о рекордах MLPerf NVIDIA пишет, что после оптимизаций TensorRT-LLM выполнение Llama 2 70B на H200 ограничивается вычислениями, а не пропускной способностью памяти.
Вся разница живёт в памяти
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Объём | 141 ГБ | 94 ГБ |
| Тип | HBM3e | HBM3 |
| Пропускная способность | 4813 ГБ/с | 3938 ГБ/с |
| Частота памяти | 3201 МГц | 2619 МГц |
| Шина | 6016 бит | 6016 бит |
| Профили MIG | до 7 по 1g.18gb | до 7 по 1g.12gb |
Источники: Product Brief H200 NVL, Product Brief H100 NVL, справочник профилей MIG. Размер инстанса расходится у самой NVIDIA: страница продукта даёт 16,5 ГБ, документация 18
У обеих NVL-карт шина шире, чем у H100 SXM: задействовано шесть стеков HBM вместо пяти, поэтому даже старая H100 NVL выдаёт 3,9 ТБ/с против 3,35 у SXM. Это разобрал ServeTheHome. Почему объём равен 94 ГБ, а не круглым 96, NVIDIA не объясняет нигде.
Сколько это даёт на конкретных задачах
Одну цифру назвать невозможно. Разброс от нуля до 3,4 раза, в зависимости от того, насколько задача упирается в память.
| Сценарий | Прирост | Кто мерил |
|---|---|---|
| Короткий контекст, 128 токенов, BF16 | около 0% | Baseten |
| То же самое в FP8 | +11% | Baseten |
| Llama 2 70B, одинаковые 700 Вт | +28% | MLPerf |
| Батч 4096, FP8 | +36% | Baseten |
| Батч 4096, BF16 | +47% | Baseten |
| Пакет HPC-приложений, заявка для NVL | до 1,3х | NVIDIA |
| Вход 32 784 токена, батч 64 | 3,4х | Baseten |
Baseten мерил на кластерах 8×H200 против 8×H100 в форм-факторе SXM, так что на NVL соотношение перенесено с оговоркой. Источники: Baseten, блог NVIDIA про MLPerf, сноски на странице H200
Вывод Baseten резче любого слогана: «вне этих ситуаций H200 даёт минимальный прирост над H100, и многие задачи инференса выгоднее на H100». Для пары NVL сама NVIDIA обещает до 1,7х на языковых моделях и до 1,3х на HPC, но условий этого теста не публикует вовсе.
Как читать цифры из презентаций
Самая громкая цифра в материалах про H200 это «110X на HPC». В сноске написано, с чем сравнивали: четыре GPU против пары процессоров Sapphire Rapids 8480. То есть это сравнение с CPU. Против H100 на том же наборе задач NVIDIA общей цифры не приводит: в сноске только перечень приложений и сравнение одной H100 SXM с одной H200 SXM.
Вторая цифра это 1,9х на Llama 2 70B. Сноска NVIDIA раскрывает условия: H100 работала с батчем 8, H200 с батчем 32. Это не подтасовка, потому что больший батч возможен именно благодаря большей памяти, в этом и смысл продукта. Но 1,9х не означает, что та же нагрузка выполнится вдвое быстрее. Это значит, что карта вытянет конфигурацию, которую предшественница не тянет. Если ваша модель уже помещается в 94 ГБ с нужным батчем, такого прироста не будет.
NVLink: здесь разница между поколениями самая большая
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Карт в группе | до 4 | только 2 |
| Память группы | 564 ГБ | 188 ГБ |
| Пропускная способность NVLink | 900 ГБ/с | 600 ГБ/с |
| Мостов на карту | 1 широкий, отдельные для 2 и 4 карт | 3 узких, те же, что в A100 PCIe |
Мосты двух поколений между собой несовместимы. Источники: Product Brief H200 NVL, Product Brief H100 NVL, референсная архитектура NVIDIA
Паспортные 900 ГБ/с считаются в обе стороны. В ветке про две H200 NVL в HPE DL385 Gen11 выложили вывод nvidia-smi: 18 активных линий по 26,562 ГБ/с, около 478 ГБ/с на GPU в одну сторону. Арифметика сходится. А карты вне общей мостовой группы общаются через PCIe Gen5 на 128 ГБ/с, примерно всемеро медленнее.
Что ещё меняется, кроме скорости
Замена карты в стойке не всегда проходит безболезненно. Вот конкретика, которой нет в таблицах облачных провайдеров.
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Мощность по умолчанию | 600 Вт | 400 Вт |
| Рабочая температура среды | 10-45 °C | 0-50 °C |
| Минимальный драйвер | R565 TRD1, CUDA 12.7 | R535, CUDA 12.2 |
| UEFI | поддерживается | не поддерживается |
| Лицензия NVIDIA AI Enterprise | 5 лет в комплекте | 5 лет в комплекте |
Источники: Product Brief обеих карт, анонс H200 NVL на SC24. Dell продаёт H200 NVL как карту 450-600 Вт, хотя аппаратный минимум в Product Brief составляет 200 Вт
Обратите внимание на вторую строку. Новая карта потребляет на 200 Вт больше, а допустимый диапазон температуры у неё уже с обеих сторон. Для машинного зала это мелочь. Для серверной комнаты в офисе, которая летом прогревается выше 45 градусов, это причина не покупать. Плюс электричество: 200 Вт разницы при круглосуточной работе дают 1752 кВт·ч на карту за год.
Когда переплата окупается, а когда хватает H100 NVL
Правило считается в одно действие. Доплата оправдана тогда, когда прирост на вашем профиле нагрузки в процентах превышает разницу в цене в процентах. Карта дороже на 40%, а у вас чат с короткими запросами и прирост 11%? Каждый токен выйдет дороже, чем на H100 NVL. Если же вы гоняете документы по 30 тысяч токенов пачками, прирост в 3,4 раза перекроет надбавку за полгода.
Второй расчёт важнее, и его почти нигде не делают. Сравнивать надо не карту с картой, а конфигурацию с конфигурацией.
| Нужно памяти под модель и KV-кеш | Что это значит на практике |
|---|---|
| до 94 ГБ | одна H100 NVL. Доплата покупает память, которой вы не пользуетесь |
| 94-141 ГБ | одна H200 NVL или пара H100 NVL с мостом. Одна карта это один слот вместо двух и 600 Вт вместо 800 |
| 141-188 ГБ | пара H100 NVL с мостом даёт 188 ГБ |
| больше 188 ГБ | только H200 NVL: пара даёт 282 ГБ, четвёрка 564 ГБ. Группы H100 NVL больше двух карт не бывает |
Производный расчёт по паспортным объёмам и максимальному размеру мостовой группы из Product Brief обеих карт
Теперь о том, зачем покупать, когда рядом есть облако. Аренда выигрывает на пиковых и разовых задачах, тут спорить не с чем. Но с обеими NVL-картами идёт пятилетняя лицензия NVIDIA AI Enterprise, а для SXM её докупают отдельно. Данные остаются в периметре, и для медицинских, финансовых и государственных проектов это вопрос допуска, а не денег. И отдельно: Hopper сворачивается, часть серверных платформ с этими GPU уже закрыла приём заказов.
Что из этого есть у нас
- PNY NVIDIA H200 NVL 141 ГБ HBM3e PCIe: розничная упаковка, в наличии
- PNY NVIDIA H200 NVL 141 ГБ HBM3e PCIe, версия BLK: то же железо в bulk, под сборку серверов партиями
- PNY NVIDIA H100 NVL 94 ГБ HBM3 PCIe: под заказ, сроки уточняйте в отделе продаж
- PNY NVIDIA RTX PRO 6000 Blackwell Server Edition 96 ГБ: если HBM избыточна, а 96 ГБ GDDR7 хватает
Частые вопросы
Работает ли H100 NVL на 94 ГБ как одиночная карта, без моста?
Да. Вопрос возникает постоянно, потому что карту долго показывали исключительно парами на 188 ГБ. ServeTheHome выпустил отдельный материал со словами «кажется почти нелепым это публиковать, но онлайн столько источников показывают их только парами, что мы решили внести ясность».
Подойдёт ли к H200 NVL мост от H100 NVL?
Нет. H100 NVL использует три узких моста, те же, что в A100 PCIe. У H200 NVL один широкий мост нового типа, с отдельными артикулами для группы из двух и из четырёх карт. При обновлении парка мосты покупаются заново.
Заработает ли MIG в KVM-виртуализации без AI Enterprise? Можно ли поднять 56 профилей 1g.18gb на сервере с восемью GPU?
Вопрос задали на форуме разработчиков NVIDIA и ответа от компании так и не получили. Арифметика 7×8 сходится, профиль 1g.18gb в документации есть. Но «сходится на бумаге» и «валидировано вендором» это разные вещи.
Поддерживается ли vGPU через mdev на H200?
По опыту владельцев на Proxmox VE 9 доступен только SR-IOV: каталогов mdev_bus и mdev_supported_types нет, а nvidia-vgpu-mgr падает с ошибкой привязки устройства. Со стороны NVIDIA на форуме добавили, что KVM на базе Proxmox пока не входит в поддерживаемые платформы AI Enterprise.
Нужен ли коммутатор InfiniBand, чтобы соединить два сервера с H200 NVL?
На форуме NVIDIA на такую же конфигурацию (два GPU в одном сервере и четыре во втором) ответили прямо: коммутатор не обязателен, достаточно соединить адаптеры ConnectX-7 напрямую. Ловушка в другом. Если GPU и сетевая карта окажутся в разных узлах NUMA, трафик пойдёт через процессор.
Работает ли NVLink внутри виртуальной машины?
Есть задокументированный случай: две H200 NVL в HPE DL385 Gen11, Proxmox VE 8.4, проброс VFIO, гость Ubuntu, драйвер 580.95.05. Все 18 линий активны внутри виртуалки. В записи честно отмечено, что Proxmox поддержку NVLink в VM официально не заявляет. Конфигурация рабочая, но вне гарантированного сценария.
Эти модели есть в каталоге
Посчитаем, что нужно именно вам
Назовите модель, длину контекста и сколько одновременных запросов планируется. Посчитаем нужный объём памяти, скажем, хватит одной карты или нужна мостовая группа, и проверим совместимость с вашей платформой.
Получить консультацию


