H200 NVL і H100 NVL побудовані на однаковому обчислювальному кремнії: ті самі 835 TFLOPS у TF32, ті самі 3341 у FP8, однаковий boost 1785 МГц. Уся різниця між ними в пам'яті. Тому питання не в тому, яка карта швидша, а в тому, чи впирається ваше навантаження саме в пам'ять. Якщо ні, доплата не купує нічого.
Коротко
- Обчислювальні характеристики ідентичні в усіх точностях, від FP64 до INT8
- Пам'яті в H200 NVL у 1,5 раза більше (141 ГБ проти 94), пропускної здатності в 1,22 раза (4813 проти 3938 ГБ/с)
- Приріст на реальних задачах гуляє від 0% до 3,4х: нуль на короткому контексті в BF16, 3,4х на вході в 32 тисячі токенів
- MLPerf при однакових 700 Вт дає +28% на Llama 2 70B, а не заявлені 90%
- H200 NVL мостить до чотирьох карт (564 ГБ), H100 NVL тільки дві (188 ГБ)
Спершу те, що ламає більшість порівнянь
Покладіть поруч таблиці специфікацій зі сторінок NVIDIA, і побачите річ, про яку в оглядах згадують рідко. Обчислювальна частина двох карт збігається до останньої цифри. Не приблизно, а точно.
| Точність | H200 NVL | H100 NVL |
|---|---|---|
| FP64 | 30 TFLOPS | 30 TFLOPS |
| FP32 | 60 TFLOPS | 60 TFLOPS |
| TF32 Tensor Core | 835 TFLOPS | 835 TFLOPS |
| BF16 і FP16 Tensor Core | 1671 TFLOPS | 1671 TFLOPS |
| FP8 і INT8 Tensor Core | 3341 TFLOPS | 3341 TFLOPS |
| Частота boost | 1785 МГц | 1785 МГц |
Значення тензорних ядер зі structured sparsity, як у виносці NVIDIA. Джерела: сторінка H200, сторінка H100
Наслідок простий. Якщо задача впирається в математику, карти працюватимуть однаково. Це не здогад: у звіті про рекорди MLPerf NVIDIA пише, що після оптимізацій TensorRT-LLM виконання Llama 2 70B на H200 обмежується обчисленнями, а не пропускною здатністю пам'яті.
Уся різниця живе в пам'яті
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Обсяг | 141 ГБ | 94 ГБ |
| Тип | HBM3e | HBM3 |
| Пропускна здатність | 4813 ГБ/с | 3938 ГБ/с |
| Частота пам'яті | 3201 МГц | 2619 МГц |
| Шина | 6016 біт | 6016 біт |
| Профілі MIG | до 7 по 1g.18gb | до 7 по 1g.12gb |
Джерела: Product Brief H200 NVL, Product Brief H100 NVL, довідник профілів MIG. Розмір інстансу розходиться в самої NVIDIA: сторінка продукту дає 16,5 ГБ, документація 18
В обох NVL-карт ширша шина, ніж у H100 SXM: задіяно шість стеків HBM замість п'яти, тому навіть стара H100 NVL дає 3,9 ТБ/с проти 3,35 у SXM. Це розібрав ServeTheHome. Чому обсяг дорівнює 94 ГБ, а не круглим 96, NVIDIA не пояснює ніде.
Скільки це дає на конкретних задачах
Одну цифру назвати неможливо. Розкид від нуля до 3,4 раза, залежно від того, наскільки задача впирається в пам'ять.
| Сценарій | Приріст | Хто міряв |
|---|---|---|
| Короткий контекст, 128 токенів, BF16 | близько 0% | Baseten |
| Те саме у FP8 | +11% | Baseten |
| Llama 2 70B, однакові 700 Вт | +28% | MLPerf |
| Батч 4096, FP8 | +36% | Baseten |
| Батч 4096, BF16 | +47% | Baseten |
| Пакет HPC-додатків, заявка для NVL | до 1,3х | NVIDIA |
| Вхід 32 784 токени, батч 64 | 3,4х | Baseten |
Baseten міряв на кластерах 8×H200 проти 8×H100 у форматі SXM, тож на NVL співвідношення перенесене із застереженням. Джерела: Baseten, блог NVIDIA про MLPerf, виноски на сторінці H200
Висновок Baseten різкіший за будь-який слоган: «поза цими ситуаціями H200 дає мінімальний приріст над H100, і багато задач інференсу вигідніші на H100». Для пари NVL сама NVIDIA обіцяє до 1,7х на мовних моделях і до 1,3х на HPC, але умов цього тесту не публікує зовсім.
Як читати цифри з презентацій
Найгучніша цифра в матеріалах про H200 це «110X на HPC». У виносці написано, з чим порівнювали: чотири GPU проти пари процесорів Sapphire Rapids 8480. Тобто це порівняння з CPU. Проти H100 на тому самому наборі задач NVIDIA загальної цифри не наводить: у виносці лише перелік застосунків і порівняння однієї H100 SXM з однією H200 SXM.
Друга цифра це 1,9х на Llama 2 70B. Виноска NVIDIA розкриває умови: H100 працювала з батчем 8, H200 з батчем 32. Це не підтасовка, бо більший батч можливий саме завдяки більшій пам'яті, і в цьому сенс продукту. Але 1,9х не означає, що те саме навантаження виконається вдвічі швидше. Воно означає, що карта витягне конфігурацію, яку попередниця не тягне. Якщо ваша модель уже вміщується в 94 ГБ із потрібним батчем, такого приросту не буде.
NVLink: тут різниця між поколіннями найбільша
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Карт у групі | до 4 | тільки 2 |
| Пам'ять групи | 564 ГБ | 188 ГБ |
| Пропускна здатність NVLink | 900 ГБ/с | 600 ГБ/с |
| Мостів на карту | 1 широкий, окремі для 2 і 4 карт | 3 вузьких, ті самі, що в A100 PCIe |
Мости двох поколінь несумісні між собою. Джерела: Product Brief H200 NVL, Product Brief H100 NVL, референсна архітектура NVIDIA
Паспортні 900 ГБ/с рахуються в обидва боки. У ветці про дві H200 NVL у HPE DL385 Gen11 виклали вивід nvidia-smi: 18 активних ліній по 26,562 ГБ/с, близько 478 ГБ/с на GPU в один бік. Арифметика сходиться. А карти поза спільною мостовою групою спілкуються через PCIe Gen5 на 128 ГБ/с, приблизно всемеро повільніше.
Що ще змінюється, крім швидкості
Заміна карти в стійці не завжди безболісна. Ось конкретика, якої немає в таблицях хмарних провайдерів.
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Потужність за замовчуванням | 600 Вт | 400 Вт |
| Робоча температура середовища | 10-45 °C | 0-50 °C |
| Мінімальний драйвер | R565 TRD1, CUDA 12.7 | R535, CUDA 12.2 |
| UEFI | підтримується | не підтримується |
| Ліцензія NVIDIA AI Enterprise | 5 років у комплекті | 5 років у комплекті |
Джерела: Product Brief обох карт, анонс H200 NVL на SC24. Dell продає H200 NVL як карту 450-600 Вт, хоча апаратний мінімум у Product Brief становить 200 Вт
Зверніть увагу на другий рядок. Новіша карта споживає на 200 Вт більше, а допустимий діапазон температури в неї вужчий з обох боків. Для машинної зали це дрібниця. Для серверної кімнати в офісі, яка влітку прогрівається вище 45 градусів, це причина не купувати. Плюс електрика: 200 Вт різниці при цілодобовій роботі дають 1752 кВт·год на карту за рік.
Коли переплата окупається, а коли H100 NVL достатньо
Правило рахується в одну дію. Доплата виправдана тоді, коли приріст на вашому профілі навантаження у відсотках перевищує різницю в ціні у відсотках. Карта дорожча на 40%, а у вас чат із короткими запитами і приріст 11%? Кожен токен коштуватиме дорожче, ніж на H100 NVL. Якщо ж ви ганяєте документи на 30 тисяч токенів пачками, приріст у 3,4 раза перекриє надбавку за пів року.
Другий розрахунок важливіший, і його майже ніде не роблять. Порівнювати треба не карту з картою, а конфігурацію з конфігурацією.
| Потрібно пам'яті під модель і KV-кеш | Що це означає на практиці |
|---|---|
| до 94 ГБ | одна H100 NVL. Доплата купує пам'ять, якою ви не користуєтесь |
| 94-141 ГБ | одна H200 NVL або пара H100 NVL з мостом. Одна карта це один слот замість двох і 600 Вт замість 800 |
| 141-188 ГБ | пара H100 NVL з мостом дає 188 ГБ |
| понад 188 ГБ | тільки H200 NVL: пара дає 282 ГБ, четвірка 564 ГБ. Групи H100 NVL більшої за дві карти не буває |
Похідний розрахунок за паспортними обсягами і максимальним розміром мостової групи з Product Brief обох карт
Тепер про те, навіщо купувати, коли поруч є хмара. Оренда виграє на пікових і разових задачах, тут сперечатись немає з чим. Але з обома NVL-картами йде п'ятирічна ліцензія NVIDIA AI Enterprise, а для SXM її докуповують окремо. Дані лишаються в периметрі, і для медичних, фінансових та державних проєктів це питання допуску, а не грошей. І окремо: Hopper згортається, частина серверних платформ із цими GPU вже закрила прийом замовлень.
Що з цього є в нас
- PNY NVIDIA H200 NVL 141 ГБ HBM3e PCIe: роздрібне пакування, в наявності
- PNY NVIDIA H200 NVL 141 ГБ HBM3e PCIe, версія BLK: те саме залізо в bulk, під складання серверів партіями
- PNY NVIDIA H100 NVL 94 ГБ HBM3 PCIe: під замовлення, строки уточнюйте у відділі продажу
- PNY NVIDIA RTX PRO 6000 Blackwell Server Edition 96 ГБ: якщо HBM надлишкова, а 96 ГБ GDDR7 вистачає
Часті питання
Чи працює H100 NVL на 94 ГБ як одиночна карта, без моста?
Так. Питання виникає постійно, бо карту довго показували виключно парами на 188 ГБ. ServeTheHome опублікував окремий матеріал зі словами «здається майже безглуздим це публікувати, але онлайн стільки джерел показують їх лише парами, що ми вирішили внести ясність».
Чи підійде до H200 NVL міст від H100 NVL?
Ні. H100 NVL використовує три вузькі мости, ті самі, що в A100 PCIe. У H200 NVL один широкий міст нового типу, з окремими артикулами для групи з двох і з чотирьох карт. При оновленні парку мости купуються заново.
Чи запрацює MIG у KVM-віртуалізації без AI Enterprise? Чи можна підняти 56 профілів 1g.18gb на сервері з вісьмома GPU?
Питання поставили на форумі розробників NVIDIA і відповіді від компанії так і не отримали. Арифметика 7×8 сходиться, профіль 1g.18gb у документації є. Але «сходиться на папері» і «валідовано вендором» це різні речі.
Чи підтримується vGPU через mdev на H200?
За досвідом власників на Proxmox VE 9 доступний тільки SR-IOV: каталогів mdev_bus і mdev_supported_types немає, а nvidia-vgpu-mgr падає з помилкою прив'язки пристрою. З боку NVIDIA на форумі додали, що KVM на базі Proxmox поки не входить у підтримувані платформи AI Enterprise.
Чи потрібен комутатор InfiniBand, щоб з'єднати два сервери з H200 NVL?
На форумі NVIDIA на таку саму конфігурацію (два GPU в одному сервері й чотири в другому) відповіли прямо: комутатор не обов'язковий, вистачить з'єднати адаптери ConnectX-7 напряму. Пастка в іншому. Якщо GPU і мережева карта опиняться в різних вузлах NUMA, трафік піде через процесор.
Чи працює NVLink усередині віртуальної машини?
Є задокументований кейс: дві H200 NVL у HPE DL385 Gen11, Proxmox VE 8.4, проброс VFIO, гість Ubuntu, драйвер 580.95.05. Усі 18 ліній активні всередині віртуалки. У дописі чесно зазначено, що Proxmox підтримки NVLink у VM офіційно не заявляє. Конфігурація робоча, але поза гарантованим сценарієм.
Ці моделі є в каталозі
Порахуємо, що потрібно саме вам
Назвіть модель, довжину контексту і скільки одночасних запитів планується. Порахуємо потрібний обсяг пам'яті, скажемо, вистачить однієї карти чи потрібна мостова група, і перевіримо сумісність із вашою платформою.
Отримати консультацію


