141 гігабайт HBM3e на одній PCIe-карті, 4,8 ТБ/с пропускної здатності і обчислювальний кристал, який не змінився з часів H100. Увесь приріст H200 NVL іде від пам'яті, і саме це визначає, кому карта дає трикратне прискорення, а кому нуль. Показуємо, де проходить межа.
Коротко
- 141 ГБ і 4 813 ГБ/с проти 94 ГБ і 3 938 ГБ/с у H100 NVL: обсяг більший у 1,5 раза, швидкість у 1,2
- Обчислення ідентичні до останнього TFLOPS: FP8 3 341, boost 1 785 МГц в обох карт
- Приріст на інференсі гуляє від 0% до 3,4 раза, вирішує довжина контексту
- Один міст NVLink на 900 ГБ/с зв'язує до чотирьох карт у пул 564 ГБ, у H100 NVL було 188 ГБ на пару
- 600 Вт на карту, пасивний радіатор, робочі 10-45 °C проти 0-50 °C у попередниці
Що змінилось, а що лишилось тим самим
Якщо покласти поруч сторінки H200 і H100 на сайті NVIDIA, видно річ, про яку в анонсах не говорять: колонки обчислювальної продуктивності NVL-версій збігаються повністю. Тридцять терафлопс FP64, 835 TF32, 3 341 FP8. Однаковий boost. Кремній той самий.
| Параметр | H200 NVL | H100 NVL |
|---|---|---|
| Пам'ять | 141 ГБ HBM3e | 94 ГБ HBM3 |
| Пропускна здатність | 4 813 ГБ/с | 3 938 ГБ/с |
| Шина пам'яті | 6 016 біт | 6 016 біт |
| FP8 Tensor Core | 3 341 TFLOPS | 3 341 TFLOPS |
| TDP за замовчуванням | 600 Вт | 400 Вт |
| NVLink | 900 ГБ/с, до 4 карт | 600 ГБ/с, тільки 2 карти |
Тензорні ядра зі structured sparsity. Джерела: сторінка H200, сторінка H100, H100 NVL Product Brief, Product Brief H200 NVL PB-12128-001
Шина в обох NVL ширша, ніж у H100 SXM: 6 016 біт проти 5 120, бо задіяно всі шість стеків HBM замість п'яти (розбір ServeTheHome). Тому навіть стара H100 NVL швидша по пам'яті за H100 SXM: 3,9 проти 3,35 ТБ/с.
Що поміщається у 141 гігабайт
Пам'ять ділять між собою ваги моделі і KV-кеш, тобто «пам'ять розмови» кожного активного запиту. Ваги це приблизно байт на параметр у 8-бітній точності і два байти в 16-бітній. Кеш для Llama 3.1 8B у BF16 займає близько 512 МБ на запит із контекстом 4 096 токенів (розрахунок RunPod), і це число множиться на кількість користувачів.
| Модель | Ваги | Одна H200 NVL |
|---|---|---|
| 70B у FP8 | близько 70 ГБ | так, ще близько 65 ГБ на кеш |
| 70B у BF16 | близько 140 ГБ | впритул, на кеш не лишається |
| 123B у FP8 | близько 123 ГБ | влазить, під батчі треба пара |
| 405B у FP8 | близько 405 ГБ | ні, потрібна четвірка на 564 ГБ |
Обсяг ваг це оцінка за правилом байта на параметр. Пул 564 ГБ у четвірці з референсної архітектури NVIDIA
Головна цінність 141 ГБ саме тут: модель класу 70B у FP8 живе на одній карті разом із запасом контексту, без тензорного паралелізму.
Скільки насправді дає приріст
Однієї цифри тут не існує. Заміри розкидані від нуля до 3,4 раза за простим правилом: чим сильніше задача впирається в пам'ять, тим більший виграш.
| Сценарій | Приріст над H100 | Хто міряв |
|---|---|---|
| Короткий контекст: чат, автодоповнення коду | 0% у BF16, +11% у FP8 | Baseten |
| Llama 2 70B при однаковій потужності 700 Вт | +28% | MLPerf, заявка NVIDIA |
| Батч 4 096 на послідовностях 2К | +36% у FP8, +47% у BF16 | Baseten |
| Контекст 32 784 токени, батч 64 | 3,4 раза | Baseten |
Джерела: Baseten, 8×H200 проти 8×H100, блог NVIDIA про MLPerf, виноски сторінки H200
Тепер про найгучніші цифри. «1,9 раза на Llama 2 70B» отримано при різних розмірах батча: у H100 вісім, у H200 тридцять два. Більший батч можливий саме завдяки пам'яті, тому цифра чесна. Але вона не про однакове навантаження: якщо задача влазить у H100 з тим самим батчем, приросту не буде.
«110 разів» на HPC-задачі MILC порівнює чотири GPU з парою процесорів Sapphire Rapids 8480, а не з H100. Порівняння з H100 NVL сама NVIDIA дає значно скромніше: до 1,3 раза на HPC. І ще одне визнання NVIDIA, яке рідко цитують: після оптимізацій TensorRT-LLM «виконання Llama 2 70B на H200 обмежене обчисленнями, а не пропускною здатністю пам'яті». Звідси і стеля.
NVL і SXM: різниця не в пам'яті
SXM це модуль на базовій платі HGX, який купують разом із сервером. NVL це PCIe-карта подвійної товщини для стандартного слота. Пам'ять у них однакова.
| Параметр | H200 NVL | H200 SXM |
|---|---|---|
| FP8 Tensor Core | 3 341 TFLOPS | 3 958 TFLOPS |
| TDP | до 600 Вт | до 700 Вт |
| GPU в одному домені NVLink | до 4 через міст | 4 або 8 через плату HGX |
| NVIDIA AI Enterprise | включено на 5 років | докуповується окремо |
Джерела: таблиця специфікацій NVIDIA, даташит PNY
Плата за форм-фактор становить 15,6% обчислень і 100 Вт бюджету. Важливіше обмеження інше. У сервері на вісім H200 NVL ви отримуєте дві незалежні четвірки, а не один домен: між ними дані йдуть через PCIe Gen5 на 128 ГБ/с, усемеро повільніше за NVLink. Для інференсу моделі до 564 ГБ це байдуже, для тренування на всі вісім карт уже ні.
Місток NVLink і чому карт максимум чотири
У H100 NVL стояло три вузькі мости на карту, ті самі, що в A100 PCIe, і зв'язати можна було рівно дві. H200 NVL використовує один широкий міст на 18 ліній: двослотовий дає 900 ГБ/с, чотирислотовий 1 800 ГБ/с. Мости поколінь несумісні, при апгрейді парку старі планки доведеться викинути.
Паспортні 900 ГБ/с це двонаправлена сума. Для пари H200 NVL, зібраної в HPE DL385 Gen11 під Proxmox VE 8.4, на форумі Proxmox опубліковано вивід nvidia-smi: усі 18 ліній активні по 26,562 ГБ/с, тобто близько 478 ГБ/с на GPU в один бік. Заодно доказ, що NVLink виживає при прокиданні карти у віртуалку, хоча офіційно Proxmox такого не обіцяє.
Вимоги до топології читають ще на етапі специфікації: мостити треба карти під одним процесором, кількість GPU рекомендована степенем двійки, а над кромкою карти потрібно лишити 2,5 мм зазору.
Чого карта хоче від сервера
| Вимога | Значення |
|---|---|
| Слот | PCIe Gen5 x16, повна висота й довжина 10,5", два слоти |
| Живлення | один роз'єм 16-pin 12VHPWR, до 600 Вт |
| Охолодження | пасивний радіатор, обдув забезпечує шасі |
| Температура середовища | 10-45 °C, у H100 NVL було 0-50 °C |
| Софт | драйвер R565 TRD1, CUDA 12.7, vGPU 18.1 і новіші |
Джерела: Product Brief NVIDIA H200 NVL PB-12128-001, Lenovo Press lp1944, даташит PNY
Два рядки таблиці варті окремої уваги. Перший очевидний: 600 Вт замість 400 Вт, у чотирикартковій збірці це зайвих 800 Вт на шасі. Другий помічають рідше. Допустиме середовище звузилось з обох боків: низ піднявся з нуля до 10 °C, верх опустився з 50 до 45 °C. Карта споживає більше, а коридор має вужчий. Стійка, у якій жили H100 NVL, під H200 NVL підходить не автоматично.
Щодо нижньої межі потужності джерела розходяться: за брифом апаратний мінімум 200 Вт, а Dell продає карту як «450W-600W». Із сумісністю так само: Lenovo бере до восьми карт у ThinkSystem SR675 V3 і до двох у SR650a V4, причому все залежить від machine type. Перевіряють не назву сервера, а SKU.
MIG, vGPU і ліцензія в комплекті
Карта ділиться на сім ізольованих інстансів, і тут NVIDIA сама собі суперечить. Сторінка продукту каже «до 7 MIG по 16,5 ГБ», а документація MIG перелічує профіль 1g.18gb у семи екземплярах. Орієнтуйтесь на документацію, бо саме її читає драйвер.
Про віртуалізацію є деталь, якої немає в маркетингових матеріалах. Для H200 NVL на Proxmox VE 9.0.3 з драйвером 570.195.02-vgpu-kvm на форумі NVIDIA симптоми описано дослівно: сервіс nvidia-vgpu-mgr падає з помилкою 0x59, каталогів mdev немає. Працює лише SR-IOV. Приємне: п'ятирічна підписка NVIDIA AI Enterprise уже входить у ціну NVL-карти, для SXM її купують окремо.
Кому цієї карти забагато
Найчесніше формулювання дала команда Baseten: «поза цими сценаріями ми бачили мінімальний приріст H200 над H100». А оскільки година H200 коштує дорожче, додають вони, чимало задач інференсу виходять дешевшими на H100.
Переплата не працює у чотирьох випадках. Модель вміщується у 94 ГБ: ви платите за пам'ять, якою не користуєтесь. Запити короткі, батчі малі, контекст у межах пари тисяч токенів: приріст близький до нуля. Стійка не тримає 600 Вт на слот або не витягує температуру нижче 45 °C. І останнє: вам потрібне тренування на восьми зв'язаних GPU, а не інференс.
Дзеркальний бік. Карта окупається на моделях від ста мільярдів параметрів, на контекстах у десятки тисяч токенів і там, де 141 ГБ дозволяє обійтись однією картою замість двох.
Що з цього є в нас
- Відеокарта PNY NVIDIA H200 NVL 141 ГБ HBM3E PCIe: роздрібне пакування, TCSH200NVLPCIE-PB
- Та сама карта у bulk-пакуванні: TCSH200NVLPCIE-BLK, під інтеграцію
- Відеокарта PNY NVIDIA H100 NVL 94 ГБ HBM3 PCIe: попереднє покоління, зараз під замовлення
Часті питання
Чи працює vGPU через mdev на H200 NVL?
Ні. Доступний тільки режим SR-IOV, 32 віртуальні функції. Питання про 56 MIG-профілів на восьми GPU у KVM без AI Enterprise на форумі NVIDIA лишилось без відповіді.
Чи потрібен комутатор, щоб з'єднати два сервери з H200 NVL?
За відповіддю модератора форуму NVIDIA, ні: два адаптери ConnectX-7 з'єднуються напряму. Пастка в іншому. Якщо карти й адаптер опиняться в різних NUMA-вузлах, трафік піде через процесори.
Чи працює одна карта H100 NVL без пари?
Так. ServeTheHome публікував про це окремий матеріал, бо в мережі багато описів «188 ГБ». Ці 188 ГБ це дві карти по 94.
Наскільки H200 NVL швидший за H100 NVL насправді?
NVIDIA заявляє до 1,7 раза на LLM-інференсі й до 1,3 раза на HPC, але умов цих вимірів не опублікувала. Незалежні заміри дають від 0% до 3,4 раза, і результат визначає довжина контексту.
Ці моделі є в каталозі
Порахувати, чи потрібні вам саме 141 ГБ?
Назвіть модель, довжину контексту, кількість одночасних запитів і марку сервера. Наші інженери скажуть, чи вистачить однієї карти.
Отримати консультацію


