Девяносто шесть гигабайт видеопамяти на одной карте. Именно за это число берут RTX PRO 6000 Blackwell, а не за частоты: на Llama 3.3 70B она обгоняет RTX 5090 примерно вдесятеро просто потому, что модель влезает целиком. Ниже спецификации из даташитов, реальные замеры и то, чего нет в презентации: 600 Вт, кабель питания и MIG, который не включается из коробки.
Коротко
- 96 ГБ GDDR7 с ECC, 24 064 CUDA-ядра, 752 тензорных ядра пятого поколения, 188 RT-ядер четвёртого
- Workstation Edition читает память на 1792 ГБ/с, Server Edition на 1597 ГБ/с. Разница 10,9 % бьёт по генерации токенов
- Llama 3.3 70B: прирост 928 % против RTX 5090, и это эффект объёма памяти, а не архитектуры
- 600 Вт через один разъём 12V-2x6. Станция под Stable Diffusion XL тянула 918 Вт в среднем и 1036 Вт на пике
- MIG делит карту на четыре инстанса по 24 ГБ, vGPU есть только у серверной версии
Что внутри
Кристалл GB202, 188 мультипроцессоров, 512-битная шина. ECC в GDDR7 работает постоянно: выключить его у пользователей не вышло, а сколько гигабайт оно резервирует, NVIDIA не сообщает.
| Характеристика | Workstation Edition |
|---|---|
| Кристалл | GB202, 92,2 млрд транзисторов, TSMC 4N |
| CUDA-ядра | 24 064 |
| Тензорные и RT-ядра | 752 тензорных (5-е поколение), 188 RT (4-е) |
| Память | 96 ГБ GDDR7 с ECC, 512 бит, 28 Гбит/с на контакт |
| Пропускная способность | 1792 ГБ/с |
| FP4, FP32, RT Core | 4000 TOPS с разрежённостью, 125 и 380 TFLOPS |
| Видеодвижки | 4x NVENC 9-го поколения, 4x NVDEC 6-го |
| Интерфейс и питание | PCIe 5.0 x16, разъём PCIe CEM5 16-pin, 600 Вт |
| Габариты | 137 x 305 мм, два слота, увеличенная высота |
Источники: страница продукта NVIDIA, whitepaper RTX Blackwell PRO GPU Architecture
Три версии, один и тот же кремний
Workstation, Max-Q и Server Edition несут одинаковый кристалл в одинаковой конфигурации. Разница сводится к тепловому бюджету, типу охлаждения и частотам. Выбирать приходится по корпусу, а не по производительности.
| Параметр | Workstation | Max-Q | Server Edition |
|---|---|---|---|
| Потребление | 600 Вт | 300 Вт | 400-600 Вт, конфигурируемое |
| Охлаждение | два осевых вентилятора, сквозной поток | турбина, выхлоп назад | пассивное |
| Пропускная способность | 1792 ГБ/с | 1792 ГБ/с | 1597 ГБ/с |
| FP32 | 125 TFLOPS | 110 TFLOPS | 120 TFLOPS |
| MIG | 4x24, 2x48, 1x96 ГБ | то же | до 4 по 24 ГБ |
| vGPU | нет | нет | до 48 машин |
| Карт в систему | реалистично 2 | до 4 | до 8 на узел |
Источники: даташиты NVIDIA и PNY, страница Server Edition, продуктовый гайд Lenovo Press, референсная архитектура NVIDIA
Официальная сравнительная таблица NVIDIA половины этих строк не содержит: в ней нет ни пропускной способности, ни CUDA-ядер, ни MIG, ни vGPU. Сравнить версии по первоисточнику покупатель не может.
Инференс: объём решает больше, чем частоты
| Модель | Токенов в секунду | Кто мерил |
|---|---|---|
| Llama 3.1 8B | 197,07 | StorageReview |
| GPT-OSS 120B | 163,15 | StorageReview |
| Gemma 3 27B | 68,06 | StorageReview |
| Llama 3.3 70B | 31,74 | StorageReview |
| Mistral Small, 26 ГБ весов | 42,4 против 17 у RTX 5090 | GamersNexus |
| Qwen3-14B на Server Edition | 103,5 против 47,3 у A5000 | HOSTKEY |
Источники: StorageReview, GamersNexus, HOSTKEY
На восьмимиллиардной модели RTX PRO 6000 и RTX 5090 идут вровень: 81 токен в секунду против 81. На Llama 3.3 70B разрыв становится 928 %, потому что 32 ГБ не хватает и часть весов уезжает в системную память. Порог «влезает или нет» даёт скачки, недостижимые для частот.
Рендер, симуляция, видео
| Тест | Результат |
|---|---|
| Blender 4.4, Monster | 7870,17 сэмпла в минуту |
| Blender 4.4, Junkshop | 4158,91 |
| V-Ray | 12 128 vpaths |
| LuxMark, Hall | 52 588 |
| Генерация видео WAN 2.2 14B, 720p | в режиме 300 Вт около 40 мин, в режиме 600 Вт около 30 мин |
Рендер: StorageReview, Workstation Edition. Видео: HOSTKEY, Server Edition в стойке
Для симуляции NVIDIA приводит собственные сравнения с L40S: секвенирование генома почти в семь раз быстрее, Smith-Waterman до 6,8 раза, text-to-video 3,3 раза, рендер более чем вдвое. Против H100 на Fastq2bam и DeepVariant заявлено 1,75 раза. Это цифры производителя, независимых проверок мы не нашли.
1597 против 1792: когда эта разница заметна
Языковая модель работает в две фазы. Сначала читает запрос целиком, тут упор в тензорные ядра. Потом генерирует ответ по одному токену, и на каждый токен читает из памяти все веса. Вторая фаза упирается в пропускную способность почти линейно, поэтому минус 10,9 % полосы у Server Edition означают примерно минус 10 % токенов в секунду. На длинном промпте отставание будет меньше: пиковая FP4 у обеих версий заявлена одинаково.
Прямого сравнения двух версий на одном хосте публично нет. На форуме разработчиков NVIDIA вопрос об этом висит без ответа с февраля 2026 года. Косвенный ориентир: на Workstation Edition снижение лимита с 600 до 300 Вт дало падение с 19,94 до 16,4 токена в секунду на DeepSeek-R1 70B в Q8, то есть минус 17,7 %.
MIG: четыре карты из одной
MIG режет GPU на изолированные инстансы со своей памятью, кешем и ядрами. У Blackwell инстанс тянет и графику, и вычисления, поэтому на одной карте можно держать VDI-сессии и инференс одновременно. Максимум четыре инстанса.
Из коробки это не включается. Нужен драйвер от 575.51.03, vBIOS не ниже 98.02.55.00.00 и перевод карты из графического режима в вычислительный утилитой DisplayModeSelector. Розничные карты ехали с vBIOS 98.02.52.00.02, отсюда поток одинаковых сообщений на форуме: «Unable to enable MIG Mode: Not Supported». После переключения карта перестаёт выводить изображение, а вернуть режим обратно удаётся не на каждой материнской плате: нужна поддержка большого BAR1. Server Edition и так едет с выключенным видеовыходом.
vGPU и VDI
Виртуализация доступна только серверной версии. С включённым MIG одна карта держит до 48 виртуальных машин: четыре инстанса по двенадцать vGPU, профили от 2 до 96 ГБ. Настольные версии vGPU не поддерживают, в гайде Lenovo для Max-Q так и написано: «No support».
Лицензии считайте отдельно от железа: по обсуждению на форуме NVIDIA, подписка AI Enterprise содержит только вычислительный профиль, а vWS для графических рабочих мест покупается отдельно.
600 Вт: что это значит для корпуса и питания
| Сценарий | Потребление |
|---|---|
| Простой | 17-20 Вт |
| Модель до 10B | 80-150 Вт |
| Генерация на модели 70B | 200-350 Вт |
| Обработка промпта | 350-500 Вт |
| Тренировка и дообучение | 450-530 Вт |
| Вся станция, Stable Diffusion XL FP16 | 918,5 Вт в среднем, пик 1036,3 Вт |
Профили нагрузки: PulsedMedia Wiki (сообщество, не производитель). Замеры станции: StorageReview
Питание идёт через один 16-контактный разъём, тот же, что на RTX 5090. Пара сигнальных контактов в нём кодирует мощность, которую блок готов отдать, и карта сама опускает потолок под кабель. Поэтому серверные сборки регулярно упираются в 450 Вт: штатный кабель Supermicro CBL-PWEX-0962Y-30 закодирован именно на 450 Вт, для полных 600 нужен CBL-PWEX-1364Y-30. Команда nvidia-smi -pl 600 это не обходит. Проверяйте кабель, а не только блок питания.
Иногда 450 Вт это осознанное решение: в ThinkSystem SR650a V4 Lenovo ставит две карты при 600 Вт или четыре при 450. Лимит покупает плотность, и по форумным оценкам инференс сохраняет 85-95 % производительности.
Теперь про корпус. Кулер Workstation Edition гонит воздух насквозь и выбрасывает его внутрь системного блока, так что вторая карта дышит выхлопом первой. Ядро под нагрузкой держит 82 °C, память 88 °C, шум 32,5 дБА. Server Edition пассивная: без сильного продува она за пару минут доходит до 100 °C и срезает себя до 125 Вт. Выглядит как неисправность, а это штатный троттлинг. Станцию на четыре карты владельцы мерили на 1650-1800 Вт от розетки.
Что из этого есть у нас
- RTX PRO 6000 Blackwell Workstation Edition 96 ГБ: максимум на карту, 600 Вт, две в станцию
- RTX PRO 6000 Blackwell Max-Q: 300 Вт и турбина с выхлопом наружу, под четырёхкарточные сборки
- RTX PRO 6000 Server Edition 96 ГБ: единственная с vGPU, Confidential Computing и Secure Boot, до восьми на узел
- RTX PRO 5000 Blackwell 72 ГБ: когда 96 ГБ много, а 48 мало
Частые вопросы
Карта держится на 450 Вт, а nvidia-smi -pl 600 не помогает. Её заблокировали на заводе?
Нет. Инженер NVIDIA в той же ветке объясняет: потолок берётся из того, что сообщает кабель. Штатный кабель серверной платформы бывает закодирован на 450 Вт, и драйвер это значение уважает. Нужен кабель на 600 Вт от производителя сервера.
Почему Server Edition тянет 125 Вт при стопроцентной загрузке GPU?
Это тепловой троттлинг, пассивная карта без мощного продува частоты не держит. На форуме Level1Techs описали печатный кожух и 60-миллиметровый вентилятор на 70-80 % оборотов: 83 °C при 600 Вт и шум уровня ручного пылесоса.
MIG отвечает «Not Supported». Что не так?
Чаще всего устаревший vBIOS или дисплейный режим: нужны драйвер от 575.51.03, vBIOS от 98.02.55.00.00 и вычислительный режим. Обновление vBIOS выдаёт поставщик карты, а не NVIDIA напрямую.
В спецификации Server Edition четыре DisplayPort, а изображения нет. Почему?
Так и задумано. Серверные карты поставляются с выключенным видеовыходом, включается он утилитой DisplayModeSelector. Проброс видеовыхода в виртуальную машину в части конфигураций так и не заработал, ветка на форуме NVIDIA закрылась без решения.
Две карты дадут 192 ГБ одним пулом?
Нет. Строки NVLink нет ни в одном из трёх даташитов, обмен идёт через PCIe 5.0, а с P2P в NCCL пользователи воюют отдельно. Две карты позволяют держать несколько моделей параллельно, а не вдвое большую.
Можно ли выключить ECC ради скорости рендера?
В прошлых поколениях так делали. На GDDR7 пользователи сообщают, что команды nvidia-smi ничего не меняют. Официального подтверждения в той ветке нет, как и данных, сколько гигабайт уходит под ECC.
Эти модели есть в каталоге
Не знаете, какая из трёх версий ваша?
Напишите, в какой корпус ставите карту, сколько их будет и что на них будет считаться. Инженер проверит питание, продув и кабели до заказа, а не после.
Получить консультацию


