Когда на одной машине живут сразу несколько моделей и каждой нужна своя память, считают не пиковую производительность, а цену гигабайта видеопамяти. По этому критерию RTX PRO 6000 Blackwell Server Edition выигрывает у серверных карт своего класса.

Что такое продакшн-инференс и чем он отличается от обучения

Обучение это разовый забег: машина месяц считает одну задачу, и объём памяти задают градиенты. Продакшн-инференс выглядит иначе. Одновременно работают модель для чата, модель для поиска по документам, модель распознавания и ещё пара мелких сервисов. Каждая держит свои веса в памяти круглосуточно.

Поэтому вопрос звучит не «какая карта самая быстрая», а «сколько моделей поместится разом и во сколько обходится каждый гигабайт». Четыре RTX PRO 6000 Server Edition дают 384 ГБ, и это самая дешёвая видеопамять среди серверных карт NVIDIA.

Конфигурация

Платформа 4U для стойки, до 8 GPU
Процессоры 2× AMD EPYC 9355
Память 768 ГБ DDR5-6400 ECC Registered, 12× 64 ГБ
Ускорители 4× NVIDIA RTX PRO 6000 Blackwell Server Edition 96 ГБ, вместе 384 ГБ
Диски 2× 960 ГБ M.2 под систему в RAID1, 2× 7.68 ТБ U.2 NVMe под данные
Сеть 2× 25GbE, опционально 200G
Питание 4× 3200 Вт с резервированием 2+2

Главное преимущество: MIG вместо очереди за картой

Классическая беда общего сервера с картами: две команды, одна карта, и кто-то всегда ждёт. Blackwell умеет делить карту аппаратно. MIG нарезает физический ускоритель на изолированные части со своей памятью и вычислительными блоками, и каждая выглядит для системы как отдельная карта.

На практике это значит, что четыре физические карты превращаются в дюжину логических. Команда разработки получает свой кусок под эксперименты, продакшн-сервис свой, и они не мешают друг другу даже когда кто-то по ошибке запускает тяжёлый скрипт.

Изоляция здесь аппаратная, а не программная: сбой в одном сегменте не роняет соседний. Это разница между «договорились не мешать» и «физически не могут».

Сколько моделей поместится

Сценарий Что выходит на 384 ГБ
Несколько средних моделей четыре модели класса 32B в половинной точности плюс запас на кеш контекста
Одна большая модель на 70B в FP16 на двух картах, оставшиеся две уходят под другие сервисы
Много мелких десяток сервисов на 7-13B, каждый в своём сегменте MIG
Расширение до 8 карт 768 ГБ, то есть вдвое больше сервисов без замены платформы

Почему Server Edition, а не обычная RTX PRO 6000

Карта той же архитектуры выпускается в двух исполнениях. Рабочее стоит в башне под столом и несёт собственный вентилятор. Серверное сделано под сквозной продув стойки: вентилятора на карте нет вообще, воздух гонят вентиляторы корпуса.

Поставить рабочую карту в плотный 4U значит перегреть её: в стойке нет места для её вентилятора, а собственный поток корпуса она не ловит. Поэтому в серверной машине только Server Edition, и наоборот.

Сравнение с машиной на H200

Критерий RTX PRO, 4 карты H200 NVL, 2 карты
Видеопамять 384 ГБ 282 ГБ общих
Память как один пул нет, четыре отдельные по 96 ГБ да, через мост NVLink
Разделение между командами MIG, до дюжины сегментов есть, но карт всего две
Сильная сторона много сервисов одновременно одна очень большая модель

Куда расти

  • Восемь карт вместо четырёх: 768 ГБ видеопамяти в том же корпусе.
  • Оперативная память до 1.5 ТБ, когда сервисов становится больше и каждый держит свой кеш.
  • Порт 200G, если машина становится частью кластера, а не одиноким узлом.

Кому подходит, а кому нет

Подходит

  • Продакшн, где несколько моделей обслуживают пользователей круглосуточно.
  • Компании, где за одни и те же карты конкурируют несколько команд.
  • Задачи, где важен объём памяти на гривну, а не рекорд в синтетическом тесте.

Лучше посмотреть на другое

  • Обучение больших моделей с нуля: там нужна общая память через NVLink, и это машина на H200.
  • Один человек и одна модель: башня под столом обойдётся дешевле и встанет в кабинете.

Частые вопросы

Можно ли связать эти карты мостом, чтобы получить один пул памяти?

Нет, и в этом главное отличие от H200 NVL. Здесь четыре независимые карты по 96 ГБ: модель крупнее 96 ГБ придётся резать программно, с соответствующей потерей скорости.

Сколько сегментов MIG даёт одна карта?

Зависит от профиля: память и вычислительные блоки делятся пропорционально. На практике карту делят на два-четыре куска, дробить мельче обычно нет смысла.

Почему памяти 768 ГБ, а не терабайт как в машине на H200?

Инференс не держит в системной памяти состояние оптимизатора и градиенты. Веса загружаются один раз, дальше работает видеопамять, поэтому запас нужен меньше.

Что будет, если карты закончатся под нагрузкой?

Платформа держит восемь, поэтому следующий шаг это докупить карты, а не менять сервер. Питание и охлаждение в конфигурации рассчитаны с запасом именно под это.

Что из этого есть у нас

Автор: Инженер ETE