Когда на одной машине живут сразу несколько моделей и каждой нужна своя память, считают не пиковую производительность, а цену гигабайта видеопамяти. По этому критерию RTX PRO 6000 Blackwell Server Edition выигрывает у серверных карт своего класса.
Что такое продакшн-инференс и чем он отличается от обучения
Обучение это разовый забег: машина месяц считает одну задачу, и объём памяти задают градиенты. Продакшн-инференс выглядит иначе. Одновременно работают модель для чата, модель для поиска по документам, модель распознавания и ещё пара мелких сервисов. Каждая держит свои веса в памяти круглосуточно.
Поэтому вопрос звучит не «какая карта самая быстрая», а «сколько моделей поместится разом и во сколько обходится каждый гигабайт». Четыре RTX PRO 6000 Server Edition дают 384 ГБ, и это самая дешёвая видеопамять среди серверных карт NVIDIA.
Конфигурация
Главное преимущество: MIG вместо очереди за картой
Классическая беда общего сервера с картами: две команды, одна карта, и кто-то всегда ждёт. Blackwell умеет делить карту аппаратно. MIG нарезает физический ускоритель на изолированные части со своей памятью и вычислительными блоками, и каждая выглядит для системы как отдельная карта.
На практике это значит, что четыре физические карты превращаются в дюжину логических. Команда разработки получает свой кусок под эксперименты, продакшн-сервис свой, и они не мешают друг другу даже когда кто-то по ошибке запускает тяжёлый скрипт.
Изоляция здесь аппаратная, а не программная: сбой в одном сегменте не роняет соседний. Это разница между «договорились не мешать» и «физически не могут».
Сколько моделей поместится
Почему Server Edition, а не обычная RTX PRO 6000
Карта той же архитектуры выпускается в двух исполнениях. Рабочее стоит в башне под столом и несёт собственный вентилятор. Серверное сделано под сквозной продув стойки: вентилятора на карте нет вообще, воздух гонят вентиляторы корпуса.
Поставить рабочую карту в плотный 4U значит перегреть её: в стойке нет места для её вентилятора, а собственный поток корпуса она не ловит. Поэтому в серверной машине только Server Edition, и наоборот.
Сравнение с машиной на H200
Куда расти
- Восемь карт вместо четырёх: 768 ГБ видеопамяти в том же корпусе.
- Оперативная память до 1.5 ТБ, когда сервисов становится больше и каждый держит свой кеш.
- Порт 200G, если машина становится частью кластера, а не одиноким узлом.
Кому подходит, а кому нет
Подходит
- Продакшн, где несколько моделей обслуживают пользователей круглосуточно.
- Компании, где за одни и те же карты конкурируют несколько команд.
- Задачи, где важен объём памяти на гривну, а не рекорд в синтетическом тесте.
Лучше посмотреть на другое
- Обучение больших моделей с нуля: там нужна общая память через NVLink, и это машина на H200.
- Один человек и одна модель: башня под столом обойдётся дешевле и встанет в кабинете.
Частые вопросы
Можно ли связать эти карты мостом, чтобы получить один пул памяти?
Нет, и в этом главное отличие от H200 NVL. Здесь четыре независимые карты по 96 ГБ: модель крупнее 96 ГБ придётся резать программно, с соответствующей потерей скорости.
Сколько сегментов MIG даёт одна карта?
Зависит от профиля: память и вычислительные блоки делятся пропорционально. На практике карту делят на два-четыре куска, дробить мельче обычно нет смысла.
Почему памяти 768 ГБ, а не терабайт как в машине на H200?
Инференс не держит в системной памяти состояние оптимизатора и градиенты. Веса загружаются один раз, дальше работает видеопамять, поэтому запас нужен меньше.
Что будет, если карты закончатся под нагрузкой?
Платформа держит восемь, поэтому следующий шаг это докупить карты, а не менять сервер. Питание и охлаждение в конфигурации рассчитаны с запасом именно под это.
Что из этого есть у нас
- ETE AI Server RTX PRO: машина из этой статьи
- ETE AI Server H200: когда нужна общая память под обучение
- ETE AI Workstation: та же карта в рабочем исполнении
- Видеокарты NVIDIA: RTX PRO 6000 Server Edition отдельно