Три карты на одном кристалле GB202, с одинаковыми 96 ГБ памяти и одинаковыми 24 064 CUDA-ядрами. Разница спрятана в тепловом бюджете, типе кулера и пропускной способности, причём последнюю NVIDIA в собственную сравнительную таблицу не поставила. Мы собрали числа из даташитов и whitepaper в одну таблицу.

Коротко

  • Кремний одинаковый: 24 064 CUDA-ядра, 752 тензорных, 188 RT-ядер, 96 ГБ GDDR7 с ECC, 512 бит
  • Пропускная способность 1792 ГБ/с у Workstation и Max-Q против 1597 ГБ/с у Server Edition, разница 10,88%
  • Мощность 600 / 300 / 400-600 Вт, кулер сквозной / турбина / пассив
  • vGPU есть только у Server Edition, до 48 виртуальных машин. В гайде Lenovo для Max-Q стоит «No support»
  • Карт в систему: две на Workstation, до четырёх на Max-Q, до восьми на Server Edition

Чего нет в сравнительной таблице NVIDIA

На странице семейства RTX PRO 6000 есть таблица, которая как бы сравнивает три версии. В ней шесть строк: объём памяти, количество DisplayPort, потребление, шина, форм-фактор и тип охлаждения. Всё, что определяет разницу в работе, из неё выброшено.

Параметр Есть ли в официальной таблице
Объём памяти, потребление, шина, форм-фактор есть
Пропускная способность памяти нет
CUDA-ядра, AI TOPS нет
MIG, vGPU нет

Состав таблицы проверен на странице семейства RTX PRO 6000 по состоянию на июль 2026

Дойти до первоисточника и сравнить три SKU не получится. Числа разбросаны по трём продуктовым страницам, трём PDF-даташитам и whitepaper, где Server Edition вообще не упомянута.

Полная таблица трёх версий

Параметр Workstation Max-Q Server Edition
CUDA-ядра 24 064 24 064 24 064
Память 96 ГБ GDDR7 ECC 96 ГБ GDDR7 ECC 96 ГБ GDDR7 ECC
Пропускная способность 1792 ГБ/с 1792 ГБ/с 1597 ГБ/с
Boost-частота 2617 МГц не публикуется не публикуется
FP32 125 TFLOPS 110 TFLOPS 120 TFLOPS
RT Core 380 TFLOPS 333 TFLOPS 355 TFLOPS
AI TOPS, FP4 sparse 4000 3511 4 PFLOPS
Потребление 600 Вт 300 Вт 400-600 Вт
Охлаждение сквозное, 2 осевых турбина назад пассивное
Габариты, 2 слота 137 x 305 мм 112 x 267 мм 112 x 267 мм
MIG 4x24, 2x48, 1x96 ГБ 4x24, 2x48, 1x96 ГБ до 4 по 24 ГБ
vGPU нет нет до 48 vGPU
Confidential Computing, Secure Boot не указано не указано есть

Источники: даташит Workstation Edition, даташит Server Edition, whitepaper Blackwell PRO, Lenovo Press

1792 против 1597 ГБ/с: на что это влияет на самом деле

Шина у всех трёх одинаковая, 512 бит, так что вся разница в частоте памяти: настольные версии несут GDDR7 на 28 Гбит/с, серверная примерно 25. Официально эту частоту NVIDIA не публикует нигде, она выводится обратным счётом из 1597 ГБ/с. Ядро тоже придержано, но меньше: FP32 ниже на 4%, RT-ядра на 6,6%, память на 10,88%.

Теперь самое важное. Генерация токенов (фаза decode) читает все веса модели на каждый токен, поэтому упирается в полосу почти линейно: минус 10,88% полосы дают около минус 10% токенов в секунду. А обработка промпта (prefill) это матричные умножения, упор в тензорные ядра, и по FP4 обе версии заявлены одинаково. На длинных промптах и батчевом инференсе разрыв будет меньше 10%.

На что разница не влияет: влезет ли модель. 96 ГБ у всех трёх, и именно этот порог даёт самые большие скачки. GamersNexus на Llama 3.3 70B зафиксировали прирост против RTX 5090 на 928%: чистый эффект того, что 32 ГБ не хватает, а 96 хватает.

Честно про предел знаний: прямого A/B-замера двух версий на одном хосте нет ни в одном проверенном источнике. На форуме разработчиков NVIDIA этот вопрос задали в феврале 2026 и ответа до сих пор нет.

Кулер решает, сколько карт у вас будет

Workstation Edition собрана по сквозной схеме с двумя осевыми вентиляторами: воздух заходит снизу, проходит через карту и уходит вверх, в корпус. Для одной карты это хорошо, GamersNexus намеряли 82 °C на ядре, 88 °C на памяти и 32,5 dBA. Для двух горячий воздух первой карты идёт прямо во вторую. Реалистичный максимум здесь две карты.

Max-Q это та же плата с классической турбиной, которая выбрасывает воздух назад через заднюю планку. Вместе с вдвое меньшим лимитом мощности это даёт до четырёх карт в станцию, поэтому OEM-сборки с четырьмя GPU делают именно на ней. Цена вопроса около 12% на FP32.

Платформа Карт Условие
Станция, Workstation Edition 2 упор в тепло, размер и питание
Станция, Max-Q 4 заявлено самой NVIDIA
Lenovo ThinkSystem SR650a V4 2 или 4 2 при 600 Вт, 4 при ограничении 450 Вт
Референсная архитектура RTX PRO Server 8 768 ГБ памяти, 12,8 ТБ/с суммарно

Источники: AEC Magazine, Lenovo Press LP2263, NVIDIA Enterprise RA

У Server Edition вентилятора нет вообще, воздух через неё гонят вентиляторы стойки. В сертифицированном шасси это работает: HOSTKEY видели до 83 °C в штатном режиме и до 90 °C в boost на 600 Вт. Вне сервера начинается цирк. В ветке Level1Techs карта за пару минут доходила до 100 °C (аварийное выключение на 104 °C) и тянула 125 Вт вместо 600, потому что душила себя сама. Вылечили кожухом и 60-миллиметровым вентилятором высокого давления. Звучит это, судя по описанию в ветке, как пылесос Dyson на столе.

Кабель, который тихо режет карту до 450 Вт

Самая дорогая ловушка в этой теме выглядит как брак. Разъём питания у всех трёх версий один, 16-контактный 12V-2x6. Контакты SENSE0 и SENSE1 кодируют мощность, которую блок готов отдать, а карта читает эту конфигурацию и сама опускает потолок.

Показательный случай. На Server Edition в шасси Supermicro nvidia-smi выдавал Max Power Limit: 450.00 W, и команда nvidia-smi -pl 600 ничего не меняла. В ответе от NVIDIA сказано, что карта не заблокирована на заводе, потолок задаёт кабель: штатный CBL-PWEX-0962Y-30 сконфигурирован на 450 Вт, для полных 600 нужен CBL-PWEX-1364Y-30. Покупать отдельно.

Иногда 450 Вт это намеренное решение производителя сервера, чтобы поставить вдвое больше карт в то же шасси. Сколько это стоит: в ветке Level1Techs на Workstation Edition снижение с 600 до 300 Вт дало падение с 20,54 до 19,29 токена в секунду на Llama 3.3 70B Q8, то есть около 6%. Половина лимита мощности обходится дешевле, чем кажется. Но бесплатной она не бывает.

MIG и vGPU: здесь версии расходятся сильнее всего

MIG заявлен у всех трёх, до четырёх изолированных инстансов на карту. На настольных версиях он не включается из коробки: нужен драйвер от 575.51.03, vBIOS от 98.02.55.00.00 и перевод карты в вычислительный режим утилитой DisplayModeSelector, после чего изображение пропадает. Розница на старте ехала с vBIOS 98.02.52.00.02, и люди закономерно получали Unable to enable MIG Mode: Not Supported.

С vGPU всё однозначно. Её имеет только Server Edition, до 48 виртуальных машин на карту: четыре MIG-инстанса, и vGPU поднимает на каждом до двенадцати ВМ. В гайде Lenovo для Max-Q строка звучит дословно: «vGPU software support: No support». Команда Proxmox говорит то же самое. Если у вас VDI или мультитенантный инференс, выбор сделан за вас.

Сценарий Какая версия
Одна карта, максимум скорости, рендер и локальные LLM Workstation
Две и больше карт в настольном корпусе, тихая комната Max-Q
Стойка, виртуализация, VDI, Confidential Computing Server Edition

Сводка по даташитам трёх версий и MIG User Guide

Чего не знает никто

Официальную частоту памяти и boost-частоту Server Edition NVIDIA не публикует, оба числа приходится выводить из соседних. Сравнительного теста двух версий на одном стенде не существует. Массы карты нет ни в одном даташите. Доступны ли на серверной версии конфигурации MIG 2x48 и 1x96 ГБ, прямо не сказано, упомянута только 4x24. Строки NVLink в даташитах нет вообще, ни в положительной, ни в отрицательной формулировке.

Что из этого есть у нас

Частые вопросы

Почему серверная карта ограничена 450 Вт, если в спецификации 600?

Карта тут ни при чём. Потолок задают sense-контакты кабеля, и карта читает их сама. Штатный кабель части серверов сконфигурирован на 450 Вт, поэтому nvidia-smi -pl 600 не сработает. Лечится заменой кабеля, у Supermicro это CBL-PWEX-1364Y-30.

Если выставить серверной карте 600 Вт, она сравняется с Workstation?

Не полностью. Лимит выровняется, а память и частота ядра останутся ниже: 1597 против 1792 ГБ/с и 120 против 125 TFLOPS в FP32. Публичного замера двух карт на одном стенде нет, поэтому точная цифра здесь будет выдумкой.

Карта показывает 100% загрузки, но потребляет 125 Вт вместо 600

Скорее всего это пассивная Server Edition без обдува: она упирается в температурный потолок и режет частоты до последнего. Бытовые 120-миллиметровые вентиляторы такого потока не дают. Нужен кожух с вентилятором высокого статического давления или сертифицированное шасси.

У Server Edition есть 4 порта DisplayPort 2.1, но изображения нет

Так задумано. Датацентровые карты едут в режиме DisplayOFF, порты включает утилита displaymodeselector, это подтверждали инженеры NVIDIA. Сложность в том, что для переключения нужна уже загруженная система.

MIG выдаёт «Not Supported» на новой карте

Проверить три вещи: драйвер R575 или новее, vBIOS (нужен от 98.02.55.00.00, розница ехала с 98.02.52.00.02) и режим дисплея, он должен быть вычислительным. Обновление vBIOS выдаёт поставщик карты.

Что дают две карты вместо одной?

Не 192 ГБ одним куском. NVLink не заявлен, обмен идёт через PCIe 5.0 x16. Две карты полезны для параллелизма по слоям, большего числа одновременных запросов или чтобы держать рядом несколько моделей.

Не уверены, какая из трёх версий ваша?

Напишите, в каком корпусе или шасси будет стоять карта, сколько их планируется и нужна ли виртуализация. Инженер подберёт версию, проверит питание и кабели и скажет, где вы потеряете производительность.

Получить консультацию