Коли на одній машині живуть кілька моделей одразу й кожній потрібна своя пам'ять, рахують не пікову продуктивність, а ціну гігабайта відеопам'яті. За цим критерієм RTX PRO 6000 Blackwell Server Edition виграє в серверних карт свого класу.

Що таке продакшн-інференс і чим він відрізняється від навчання

Навчання це разовий забіг: машина місяць рахує одну задачу, вирішує обсяг пам'яті під градієнти. Продакшн-інференс виглядає інакше. Одночасно працюють модель для чату, модель для пошуку по документах, модель розпізнавання й ще пара дрібних сервісів. Кожна тримає свої ваги в пам'яті цілодобово.

Тому питання звучить не «яка карта найшвидша», а «скільки моделей одночасно вміститься й скільки коштує кожен гігабайт». Чотири RTX PRO 6000 Server Edition дають 384 ГБ, і це найдешевша відеопам'ять серед серверних карт NVIDIA.

Конфігурація

Платформа 4U для стійки, до 8 GPU
Процесори 2× AMD EPYC 9355
Пам'ять 768 ГБ DDR5-6400 ECC Registered, 12× 64 ГБ
Прискорювачі 4× NVIDIA RTX PRO 6000 Blackwell Server Edition 96 ГБ, разом 384 ГБ
Диски 2× 960 ГБ M.2 під систему в RAID1, 2× 7.68 ТБ U.2 NVMe під дані
Мережа 2× 25GbE, опційно 200G
Живлення 4× 3200 Вт із резервуванням 2+2

Головна перевага: MIG замість черги за картою

Класична біда спільного сервера з картами: дві команди, одна карта, і хтось завжди чекає. Blackwell уміє ділити карту апаратно. MIG нарізає фізичний прискорювач на ізольовані частини зі своєю пам'яттю й обчислювальними блоками, і кожна виглядає для системи як окрема карта.

Практично це означає, що чотири фізичні карти перетворюються на дюжину логічних. Команда розробки отримує свій шматок під експерименти, продакшн-сервіс свій, і вони не заважають одне одному навіть коли хтось помилково запускає важкий скрипт.

Ізоляція тут апаратна, а не програмна: збій в одному сегменті не валить сусідній. Це різниця між «домовились не заважати» і «фізично не можуть».

Скільки моделей поміститься

Сценарій Що виходить на 384 ГБ
Кілька середніх моделей чотири моделі класу 32B у половинній точності плюс запас на кеш контексту
Одна велика модель на 70B у FP16 на двох картах, решта дві лишаються під інші сервіси
Багато дрібних десяток сервісів на 7-13B, кожен у своєму сегменті MIG
Розширення до 8 карт 768 ГБ, тобто вдвічі більше сервісів без заміни платформи

Чому Server Edition, а не звичайна RTX PRO 6000

Карта тієї самої архітектури існує у двох виконаннях. Робоче стоїть у башті під столом і має власний вентилятор. Серверне зроблене під наскрізний продув стійки: вентилятора на карті немає взагалі, повітря женуть вентилятори корпусу.

Поставити робочу карту в щільний 4U означає перегріти її: у стійці немає місця для її вентилятора, а власного потоку корпусу вона не ловить. Тому в серверній машині тільки Server Edition, і навпаки.

Порівняння з машиною на H200

Критерій RTX PRO, 4 карти H200 NVL, 2 карти
Відеопам'ять 384 ГБ 282 ГБ спільних
Пам'ять як один пул ні, чотири окремі по 96 ГБ так, через міст NVLink
Поділ між командами MIG, до дюжини сегментів є, але карт лише дві
Сильна сторона багато сервісів одночасно одна дуже велика модель

Куди зростати

  • Вісім карт замість чотирьох: 768 ГБ відеопам'яті в тому самому корпусі.
  • Оперативна пам'ять до 1.5 ТБ, коли сервісів стає більше й кожен тримає свій кеш.
  • Порт 200G, якщо машина стає частиною кластера, а не самотнім вузлом.

Кому підходить, а кому ні

Підходить

  • Продакшн, де кілька моделей обслуговують користувачів цілодобово.
  • Компанії, де за одні карти конкурують кілька команд.
  • Задачі, де важливий обсяг пам'яті на гривню, а не рекорд у синтетичному тесті.

Краще подивитись на інше

  • Навчання великих моделей із нуля: там потрібна спільна пам'ять через NVLink, і це машина на H200.
  • Одна людина й одна модель: башта під столом обійдеться дешевше й стане в кабінеті.

Часті питання

Чи можна зв'язати ці карти мостом, щоб отримати один пул пам'яті?

Ні, і в цьому головна різниця з H200 NVL. Тут чотири незалежні карти по 96 ГБ: модель, більша за 96 ГБ, доведеться різати програмно, з відповідною втратою швидкості.

Скільки сегментів MIG дає одна карта?

Залежить від профілю: пам'ять і обчислювальні блоки діляться пропорційно. На практиці карту ділять на два-чотири шматки, більше дрібних сегментів рідко мають сенс.

Чому пам'яті 768 ГБ, а не терабайт як у H200-машині?

Інференс не тримає в системній пам'яті стан оптимізатора й градієнти. Ваги завантажуються один раз, далі працює відеопам'ять, тому запас потрібен менший.

Що буде, якщо карти закінчаться під навантаженням?

Платформа тримає вісім, тому наступний крок це докупити карти, а не міняти сервер. Живлення й охолодження в конфігурації розраховані з запасом саме під це.

Що з цього є в нас

Автор: Інженер ETE