Девяносто шесть гигабайт видеопамяти на одной карте. Именно за это число берут RTX PRO 6000 Blackwell, а не за частоты: на Llama 3.3 70B она обгоняет RTX 5090 примерно вдесятеро просто потому, что модель влезает целиком. Ниже спецификации из даташитов, реальные замеры и то, чего нет в презентации: 600 Вт, кабель питания и MIG, который не включается из коробки.

Коротко

  • 96 ГБ GDDR7 с ECC, 24 064 CUDA-ядра, 752 тензорных ядра пятого поколения, 188 RT-ядер четвёртого
  • Workstation Edition читает память на 1792 ГБ/с, Server Edition на 1597 ГБ/с. Разница 10,9 % бьёт по генерации токенов
  • Llama 3.3 70B: прирост 928 % против RTX 5090, и это эффект объёма памяти, а не архитектуры
  • 600 Вт через один разъём 12V-2x6. Станция под Stable Diffusion XL тянула 918 Вт в среднем и 1036 Вт на пике
  • MIG делит карту на четыре инстанса по 24 ГБ, vGPU есть только у серверной версии

Что внутри

Кристалл GB202, 188 мультипроцессоров, 512-битная шина. ECC в GDDR7 работает постоянно: выключить его у пользователей не вышло, а сколько гигабайт оно резервирует, NVIDIA не сообщает.

Характеристика Workstation Edition
Кристалл GB202, 92,2 млрд транзисторов, TSMC 4N
CUDA-ядра 24 064
Тензорные и RT-ядра 752 тензорных (5-е поколение), 188 RT (4-е)
Память 96 ГБ GDDR7 с ECC, 512 бит, 28 Гбит/с на контакт
Пропускная способность 1792 ГБ/с
FP4, FP32, RT Core 4000 TOPS с разрежённостью, 125 и 380 TFLOPS
Видеодвижки 4x NVENC 9-го поколения, 4x NVDEC 6-го
Интерфейс и питание PCIe 5.0 x16, разъём PCIe CEM5 16-pin, 600 Вт
Габариты 137 x 305 мм, два слота, увеличенная высота

Источники: страница продукта NVIDIA, whitepaper RTX Blackwell PRO GPU Architecture

Три версии, один и тот же кремний

Workstation, Max-Q и Server Edition несут одинаковый кристалл в одинаковой конфигурации. Разница сводится к тепловому бюджету, типу охлаждения и частотам. Выбирать приходится по корпусу, а не по производительности.

Параметр Workstation Max-Q Server Edition
Потребление 600 Вт 300 Вт 400-600 Вт, конфигурируемое
Охлаждение два осевых вентилятора, сквозной поток турбина, выхлоп назад пассивное
Пропускная способность 1792 ГБ/с 1792 ГБ/с 1597 ГБ/с
FP32 125 TFLOPS 110 TFLOPS 120 TFLOPS
MIG 4x24, 2x48, 1x96 ГБ то же до 4 по 24 ГБ
vGPU нет нет до 48 машин
Карт в систему реалистично 2 до 4 до 8 на узел

Источники: даташиты NVIDIA и PNY, страница Server Edition, продуктовый гайд Lenovo Press, референсная архитектура NVIDIA

Официальная сравнительная таблица NVIDIA половины этих строк не содержит: в ней нет ни пропускной способности, ни CUDA-ядер, ни MIG, ни vGPU. Сравнить версии по первоисточнику покупатель не может.

Инференс: объём решает больше, чем частоты

Модель Токенов в секунду Кто мерил
Llama 3.1 8B 197,07 StorageReview
GPT-OSS 120B 163,15 StorageReview
Gemma 3 27B 68,06 StorageReview
Llama 3.3 70B 31,74 StorageReview
Mistral Small, 26 ГБ весов 42,4 против 17 у RTX 5090 GamersNexus
Qwen3-14B на Server Edition 103,5 против 47,3 у A5000 HOSTKEY

Источники: StorageReview, GamersNexus, HOSTKEY

На восьмимиллиардной модели RTX PRO 6000 и RTX 5090 идут вровень: 81 токен в секунду против 81. На Llama 3.3 70B разрыв становится 928 %, потому что 32 ГБ не хватает и часть весов уезжает в системную память. Порог «влезает или нет» даёт скачки, недостижимые для частот.

Рендер, симуляция, видео

Тест Результат
Blender 4.4, Monster 7870,17 сэмпла в минуту
Blender 4.4, Junkshop 4158,91
V-Ray 12 128 vpaths
LuxMark, Hall 52 588
Генерация видео WAN 2.2 14B, 720p в режиме 300 Вт около 40 мин, в режиме 600 Вт около 30 мин

Рендер: StorageReview, Workstation Edition. Видео: HOSTKEY, Server Edition в стойке

Для симуляции NVIDIA приводит собственные сравнения с L40S: секвенирование генома почти в семь раз быстрее, Smith-Waterman до 6,8 раза, text-to-video 3,3 раза, рендер более чем вдвое. Против H100 на Fastq2bam и DeepVariant заявлено 1,75 раза. Это цифры производителя, независимых проверок мы не нашли.

1597 против 1792: когда эта разница заметна

Языковая модель работает в две фазы. Сначала читает запрос целиком, тут упор в тензорные ядра. Потом генерирует ответ по одному токену, и на каждый токен читает из памяти все веса. Вторая фаза упирается в пропускную способность почти линейно, поэтому минус 10,9 % полосы у Server Edition означают примерно минус 10 % токенов в секунду. На длинном промпте отставание будет меньше: пиковая FP4 у обеих версий заявлена одинаково.

Прямого сравнения двух версий на одном хосте публично нет. На форуме разработчиков NVIDIA вопрос об этом висит без ответа с февраля 2026 года. Косвенный ориентир: на Workstation Edition снижение лимита с 600 до 300 Вт дало падение с 19,94 до 16,4 токена в секунду на DeepSeek-R1 70B в Q8, то есть минус 17,7 %.

MIG: четыре карты из одной

MIG режет GPU на изолированные инстансы со своей памятью, кешем и ядрами. У Blackwell инстанс тянет и графику, и вычисления, поэтому на одной карте можно держать VDI-сессии и инференс одновременно. Максимум четыре инстанса.

Из коробки это не включается. Нужен драйвер от 575.51.03, vBIOS не ниже 98.02.55.00.00 и перевод карты из графического режима в вычислительный утилитой DisplayModeSelector. Розничные карты ехали с vBIOS 98.02.52.00.02, отсюда поток одинаковых сообщений на форуме: «Unable to enable MIG Mode: Not Supported». После переключения карта перестаёт выводить изображение, а вернуть режим обратно удаётся не на каждой материнской плате: нужна поддержка большого BAR1. Server Edition и так едет с выключенным видеовыходом.

vGPU и VDI

Виртуализация доступна только серверной версии. С включённым MIG одна карта держит до 48 виртуальных машин: четыре инстанса по двенадцать vGPU, профили от 2 до 96 ГБ. Настольные версии vGPU не поддерживают, в гайде Lenovo для Max-Q так и написано: «No support».

Лицензии считайте отдельно от железа: по обсуждению на форуме NVIDIA, подписка AI Enterprise содержит только вычислительный профиль, а vWS для графических рабочих мест покупается отдельно.

600 Вт: что это значит для корпуса и питания

Сценарий Потребление
Простой 17-20 Вт
Модель до 10B 80-150 Вт
Генерация на модели 70B 200-350 Вт
Обработка промпта 350-500 Вт
Тренировка и дообучение 450-530 Вт
Вся станция, Stable Diffusion XL FP16 918,5 Вт в среднем, пик 1036,3 Вт

Профили нагрузки: PulsedMedia Wiki (сообщество, не производитель). Замеры станции: StorageReview

Питание идёт через один 16-контактный разъём, тот же, что на RTX 5090. Пара сигнальных контактов в нём кодирует мощность, которую блок готов отдать, и карта сама опускает потолок под кабель. Поэтому серверные сборки регулярно упираются в 450 Вт: штатный кабель Supermicro CBL-PWEX-0962Y-30 закодирован именно на 450 Вт, для полных 600 нужен CBL-PWEX-1364Y-30. Команда nvidia-smi -pl 600 это не обходит. Проверяйте кабель, а не только блок питания.

Иногда 450 Вт это осознанное решение: в ThinkSystem SR650a V4 Lenovo ставит две карты при 600 Вт или четыре при 450. Лимит покупает плотность, и по форумным оценкам инференс сохраняет 85-95 % производительности.

Теперь про корпус. Кулер Workstation Edition гонит воздух насквозь и выбрасывает его внутрь системного блока, так что вторая карта дышит выхлопом первой. Ядро под нагрузкой держит 82 °C, память 88 °C, шум 32,5 дБА. Server Edition пассивная: без сильного продува она за пару минут доходит до 100 °C и срезает себя до 125 Вт. Выглядит как неисправность, а это штатный троттлинг. Станцию на четыре карты владельцы мерили на 1650-1800 Вт от розетки.

Что из этого есть у нас

Частые вопросы

Карта держится на 450 Вт, а nvidia-smi -pl 600 не помогает. Её заблокировали на заводе?

Нет. Инженер NVIDIA в той же ветке объясняет: потолок берётся из того, что сообщает кабель. Штатный кабель серверной платформы бывает закодирован на 450 Вт, и драйвер это значение уважает. Нужен кабель на 600 Вт от производителя сервера.

Почему Server Edition тянет 125 Вт при стопроцентной загрузке GPU?

Это тепловой троттлинг, пассивная карта без мощного продува частоты не держит. На форуме Level1Techs описали печатный кожух и 60-миллиметровый вентилятор на 70-80 % оборотов: 83 °C при 600 Вт и шум уровня ручного пылесоса.

MIG отвечает «Not Supported». Что не так?

Чаще всего устаревший vBIOS или дисплейный режим: нужны драйвер от 575.51.03, vBIOS от 98.02.55.00.00 и вычислительный режим. Обновление vBIOS выдаёт поставщик карты, а не NVIDIA напрямую.

В спецификации Server Edition четыре DisplayPort, а изображения нет. Почему?

Так и задумано. Серверные карты поставляются с выключенным видеовыходом, включается он утилитой DisplayModeSelector. Проброс видеовыхода в виртуальную машину в части конфигураций так и не заработал, ветка на форуме NVIDIA закрылась без решения.

Две карты дадут 192 ГБ одним пулом?

Нет. Строки NVLink нет ни в одном из трёх даташитов, обмен идёт через PCIe 5.0, а с P2P в NCCL пользователи воюют отдельно. Две карты позволяют держать несколько моделей параллельно, а не вдвое большую.

Можно ли выключить ECC ради скорости рендера?

В прошлых поколениях так делали. На GDDR7 пользователи сообщают, что команды nvidia-smi ничего не меняют. Официального подтверждения в той ветке нет, как и данных, сколько гигабайт уходит под ECC.

Не знаете, какая из трёх версий ваша?

Напишите, в какой корпус ставите карту, сколько их будет и что на них будет считаться. Инженер проверит питание, продув и кабели до заказа, а не после.

Получить консультацию

Автор: Инженер ETE