Коли на одній машині живуть кілька моделей одразу й кожній потрібна своя пам'ять, рахують не пікову продуктивність, а ціну гігабайта відеопам'яті. За цим критерієм RTX PRO 6000 Blackwell Server Edition виграє в серверних карт свого класу.
Що таке продакшн-інференс і чим він відрізняється від навчання
Навчання це разовий забіг: машина місяць рахує одну задачу, вирішує обсяг пам'яті під градієнти. Продакшн-інференс виглядає інакше. Одночасно працюють модель для чату, модель для пошуку по документах, модель розпізнавання й ще пара дрібних сервісів. Кожна тримає свої ваги в пам'яті цілодобово.
Тому питання звучить не «яка карта найшвидша», а «скільки моделей одночасно вміститься й скільки коштує кожен гігабайт». Чотири RTX PRO 6000 Server Edition дають 384 ГБ, і це найдешевша відеопам'ять серед серверних карт NVIDIA.
Конфігурація
Головна перевага: MIG замість черги за картою
Класична біда спільного сервера з картами: дві команди, одна карта, і хтось завжди чекає. Blackwell уміє ділити карту апаратно. MIG нарізає фізичний прискорювач на ізольовані частини зі своєю пам'яттю й обчислювальними блоками, і кожна виглядає для системи як окрема карта.
Практично це означає, що чотири фізичні карти перетворюються на дюжину логічних. Команда розробки отримує свій шматок під експерименти, продакшн-сервіс свій, і вони не заважають одне одному навіть коли хтось помилково запускає важкий скрипт.
Ізоляція тут апаратна, а не програмна: збій в одному сегменті не валить сусідній. Це різниця між «домовились не заважати» і «фізично не можуть».
Скільки моделей поміститься
Чому Server Edition, а не звичайна RTX PRO 6000
Карта тієї самої архітектури існує у двох виконаннях. Робоче стоїть у башті під столом і має власний вентилятор. Серверне зроблене під наскрізний продув стійки: вентилятора на карті немає взагалі, повітря женуть вентилятори корпусу.
Поставити робочу карту в щільний 4U означає перегріти її: у стійці немає місця для її вентилятора, а власного потоку корпусу вона не ловить. Тому в серверній машині тільки Server Edition, і навпаки.
Порівняння з машиною на H200
Куди зростати
- Вісім карт замість чотирьох: 768 ГБ відеопам'яті в тому самому корпусі.
- Оперативна пам'ять до 1.5 ТБ, коли сервісів стає більше й кожен тримає свій кеш.
- Порт 200G, якщо машина стає частиною кластера, а не самотнім вузлом.
Кому підходить, а кому ні
Підходить
- Продакшн, де кілька моделей обслуговують користувачів цілодобово.
- Компанії, де за одні карти конкурують кілька команд.
- Задачі, де важливий обсяг пам'яті на гривню, а не рекорд у синтетичному тесті.
Краще подивитись на інше
- Навчання великих моделей із нуля: там потрібна спільна пам'ять через NVLink, і це машина на H200.
- Одна людина й одна модель: башта під столом обійдеться дешевше й стане в кабінеті.
Часті питання
Чи можна зв'язати ці карти мостом, щоб отримати один пул пам'яті?
Ні, і в цьому головна різниця з H200 NVL. Тут чотири незалежні карти по 96 ГБ: модель, більша за 96 ГБ, доведеться різати програмно, з відповідною втратою швидкості.
Скільки сегментів MIG дає одна карта?
Залежить від профілю: пам'ять і обчислювальні блоки діляться пропорційно. На практиці карту ділять на два-чотири шматки, більше дрібних сегментів рідко мають сенс.
Чому пам'яті 768 ГБ, а не терабайт як у H200-машині?
Інференс не тримає в системній пам'яті стан оптимізатора й градієнти. Ваги завантажуються один раз, далі працює відеопам'ять, тому запас потрібен менший.
Що буде, якщо карти закінчаться під навантаженням?
Платформа тримає вісім, тому наступний крок це докупити карти, а не міняти сервер. Живлення й охолодження в конфігурації розраховані з запасом саме під це.
Що з цього є в нас
- ETE AI Server RTX PRO: машина з цієї статті
- ETE AI Server H200: коли потрібна спільна пам'ять під навчання
- ETE AI Workstation: та сама карта в робочому виконанні
- Відеокарти NVIDIA: RTX PRO 6000 Server Edition окремо