Дев'яносто шість гігабайт відеопам'яті на одній карті. Саме за це число купують RTX PRO 6000 Blackwell, а не за частоти: на Llama 3.3 70B вона обганяє RTX 5090 приблизно вдесятеро просто тому, що модель влазить цілком. Нижче специфікації з даташитів, реальні заміри і те, чого немає в презентації: 600 Вт, кабель живлення і MIG, який не вмикається з коробки.

Коротко

  • 96 ГБ GDDR7 з ECC, 24 064 CUDA-ядра, 752 тензорних ядра п'ятого покоління, 188 RT-ядер четвертого
  • Workstation Edition читає пам'ять на 1792 ГБ/с, Server Edition на 1597 ГБ/с. Різниця 10,9 % б'є по генерації токенів
  • Llama 3.3 70B: приріст 928 % проти RTX 5090, і це ефект обсягу пам'яті, а не архітектури
  • 600 Вт через один роз'єм 12V-2x6. Станція під Stable Diffusion XL тягнула 918 Вт у середньому і 1036 Вт на піку
  • MIG ділить карту на чотири інстанси по 24 ГБ, vGPU є тільки в серверній версії

Що всередині

Кристал GB202, 188 мультипроцесорів, 512-бітна шина. ECC у GDDR7 працює постійно: вимкнути його користувачі не змогли, і скільки гігабайтів воно резервує, NVIDIA не повідомляє.

Характеристика Workstation Edition
Кристал GB202, 92,2 млрд транзисторів, TSMC 4N
CUDA-ядра 24 064
Тензорні та RT-ядра 752 тензорних (5-те покоління), 188 RT (4-те)
Пам'ять 96 ГБ GDDR7 з ECC, 512 біт, 28 Гбіт/с на контакт
Пропускна здатність 1792 ГБ/с
FP4, FP32, RT Core 4000 TOPS з розрідженістю, 125 і 380 TFLOPS
Відеорушії 4x NVENC 9-го покоління, 4x NVDEC 6-го
Інтерфейс і живлення PCIe 5.0 x16, роз'єм PCIe CEM5 16-pin, 600 Вт
Габарити 137 x 305 мм, два слоти, підвищена висота

Джерела: сторінка продукту NVIDIA, whitepaper RTX Blackwell PRO GPU Architecture

Три версії, один і той самий кремній

Workstation, Max-Q і Server Edition мають однаковий кристал в однаковій конфігурації. Різниця зводиться до теплового бюджету, типу охолодження і частот. Обирати доводиться за корпусом, а не за продуктивністю.

Параметр Workstation Max-Q Server Edition
Споживання 600 Вт 300 Вт 400-600 Вт, конфігуроване
Охолодження два осьові вентилятори, наскрізний потік турбіна, вихлоп назад пасивне
Пропускна здатність 1792 ГБ/с 1792 ГБ/с 1597 ГБ/с
FP32 125 TFLOPS 110 TFLOPS 120 TFLOPS
MIG 4x24, 2x48, 1x96 ГБ те саме до 4 по 24 ГБ
vGPU немає немає до 48 машин
Карт у систему реалістично 2 до 4 до 8 на вузол

Джерела: даташити NVIDIA і PNY, сторінка Server Edition, продуктовий гайд Lenovo Press, референсна архітектура NVIDIA

Офіційна порівняльна таблиця NVIDIA половини цих рядків не містить: у ній немає ані пропускної здатності, ані CUDA-ядер, ані MIG, ані vGPU. Порівняти версії за первинним джерелом покупець не може.

Інференс: обсяг вирішує більше за частоти

Модель Токенів за секунду Хто міряв
Llama 3.1 8B 197,07 StorageReview
GPT-OSS 120B 163,15 StorageReview
Gemma 3 27B 68,06 StorageReview
Llama 3.3 70B 31,74 StorageReview
Mistral Small, 26 ГБ ваг 42,4 проти 17 у RTX 5090 GamersNexus
Qwen3-14B на Server Edition 103,5 проти 47,3 у A5000 HOSTKEY

Джерела: StorageReview, GamersNexus, HOSTKEY

На восьмимільярдній моделі RTX PRO 6000 і RTX 5090 йдуть нарівні: 81 токен за секунду проти 81. На Llama 3.3 70B розрив стає 928 %, бо 32 ГБ не вистачає і частина ваг їде в системну пам'ять. Поріг «влазить чи ні» дає стрибки, недосяжні для частот.

Рендер, симуляція, відео

Тест Результат
Blender 4.4, Monster 7870,17 семпла за хвилину
Blender 4.4, Junkshop 4158,91
V-Ray 12 128 vpaths
LuxMark, Hall 52 588
Генерація відео WAN 2.2 14B, 720p у режимі 300 Вт близько 40 хв, у режимі 600 Вт близько 30 хв

Рендер: StorageReview, Workstation Edition. Відео: HOSTKEY, Server Edition у стійці

Для симуляції NVIDIA наводить власні порівняння з L40S: секвенування геному майже в сім разів швидше, Smith-Waterman до 6,8 раза, text-to-video 3,3 раза, рендер понад удвічі. Проти H100 на Fastq2bam і DeepVariant заявлено 1,75 раза. Це цифри виробника, незалежних перевірок ми не знайшли.

1597 проти 1792: коли ця різниця помітна

Мовна модель працює у дві фази. Спочатку читає запит цілком, тут упор у тензорні ядра. Потім генерує відповідь по одному токену, і на кожен токен читає з пам'яті всі ваги. Друга фаза впирається в пропускну здатність майже лінійно, тому мінус 10,9 % смуги в Server Edition означає приблизно мінус 10 % токенів за секунду. На довгому промпті відставання буде меншим: пікова FP4 в обох версіях заявлена однаково.

Прямого порівняння двох версій на одному хості публічно немає. На форумі розробників NVIDIA питання про це висить без відповіді з лютого 2026 року. Непрямий орієнтир: на Workstation Edition зниження ліміту з 600 до 300 Вт дало падіння з 19,94 до 16,4 токена за секунду на DeepSeek-R1 70B у Q8, тобто мінус 17,7 %.

MIG: чотири карти з однієї

MIG ріже GPU на ізольовані інстанси зі своєю пам'яттю, кешем і ядрами. У Blackwell інстанс тягне і графіку, і обчислення, тому на одній карті можна тримати VDI-сесії та інференс одночасно. Максимум чотири інстанси.

З коробки це не вмикається. Потрібен драйвер від 575.51.03, vBIOS не нижче 98.02.55.00.00 і перемикання карти з графічного режиму в обчислювальний утилітою DisplayModeSelector. Роздрібні карти їхали з vBIOS 98.02.52.00.02, звідси потік однакових повідомлень на форумі: «Unable to enable MIG Mode: Not Supported». Після перемикання карта перестає виводити зображення, а повернути режим назад вдається не на кожній материнській платі: потрібна підтримка великого BAR1. Server Edition і так їде з вимкненим відеовиходом.

vGPU і VDI

Віртуалізація доступна тільки серверній версії. З увімкненим MIG одна карта тримає до 48 віртуальних машин: чотири інстанси по дванадцять vGPU, профілі від 2 до 96 ГБ. Настільні версії vGPU не підтримують, у гайді Lenovo для Max-Q так і написано: «No support».

Ліцензії рахуйте окремо від заліза: за обговоренням на форумі NVIDIA, підписка AI Enterprise містить лише обчислювальний профіль, а vWS для графічних робочих місць купується окремо.

600 Вт: що це означає для корпусу і живлення

Сценарій Споживання
Простій 17-20 Вт
Модель до 10B 80-150 Вт
Генерація на моделі 70B 200-350 Вт
Обробка промпту 350-500 Вт
Тренування і донавчання 450-530 Вт
Уся станція, Stable Diffusion XL FP16 918,5 Вт у середньому, пік 1036,3 Вт

Профілі навантаження: PulsedMedia Wiki (спільнота, не виробник). Заміри станції: StorageReview

Живлення йде через один 16-контактний роз'єм, той самий, що на RTX 5090. Пара сигнальних контактів у ньому кодує потужність, яку блок готовий віддати, і карта сама опускає стелю під кабель. Тому серверні збірки регулярно впираються в 450 Вт: штатний кабель Supermicro CBL-PWEX-0962Y-30 закодований саме на 450 Вт, для повних 600 потрібен CBL-PWEX-1364Y-30. Команда nvidia-smi -pl 600 цього не обходить. Перевіряйте кабель, не тільки блок живлення.

Іноді 450 Вт це свідоме рішення: у ThinkSystem SR650a V4 Lenovo ставить дві карти при 600 Вт або чотири при 450. Ліміт купує щільність, і за форумними оцінками інференс зберігає 85-95 % продуктивності.

Тепер про корпус. Кулер Workstation Edition жене повітря наскрізь і викидає його всередину системного блока, тому друга карта дихає вихлопом першої. Ядро під навантаженням тримає 82 °C, пам'ять 88 °C, шум 32,5 дБА. Server Edition пасивна: без сильного продуву вона за пару хвилин доходить до 100 °C і зрізає себе до 125 Вт. Виглядає як несправність, а це штатний тротлінг. Станцію на чотири карти власники міряли на 1650-1800 Вт від розетки.

Що з цього є в нас

Часті питання

Карта тримається на 450 Вт, а nvidia-smi -pl 600 не допомагає. Її заблокували на заводі?

Ні. Інженер NVIDIA у тому ж треді пояснює: стеля береться з того, що повідомляє кабель. Штатний кабель серверної платформи буває закодований на 450 Вт, і драйвер це значення поважає. Потрібен кабель на 600 Вт від виробника сервера.

Чому Server Edition тягне 125 Вт при стовідсотковому завантаженні GPU?

Це тепловий тротлінг, пасивна карта без потужного продуву частоти не тримає. На форумі Level1Techs описали друкований кожух і 60-міліметровий вентилятор на 70-80 % обертів: 83 °C при 600 Вт і шум рівня ручного пилососа.

MIG відповідає «Not Supported». Що не так?

Найчастіше застарілий vBIOS або дисплейний режим: потрібні драйвер від 575.51.03, vBIOS від 98.02.55.00.00 і обчислювальний режим. Оновлення vBIOS видає постачальник карти, не NVIDIA напряму.

У специфікації Server Edition чотири DisplayPort, а зображення немає. Чому?

Так і має бути. Серверні карти постачаються з вимкненим відеовиходом, вмикається він утилітою DisplayModeSelector. Прокидання відеовиходу у віртуальну машину в частині конфігурацій так і не запрацювало, гілка на форумі NVIDIA закрилася без розв'язання.

Дві карти дадуть 192 ГБ одним пулом?

Ні. Рядка NVLink немає в жодному з трьох даташитів, обмін іде через PCIe 5.0, а з P2P у NCCL користувачі воюють окремо. Дві карти дозволяють тримати кілька моделей паралельно, а не вдвічі більшу.

Чи можна вимкнути ECC заради швидкості рендера?

У попередніх поколіннях так робили. На GDDR7 користувачі повідомляють, що команди nvidia-smi нічого не змінюють. Офіційного підтвердження в тій гілці немає, як і даних, скільки гігабайтів іде під ECC.

Не знаєте, яка з трьох версій ваша?

Напишіть, у який корпус ставите карту, скільки їх буде і що на них рахуватиметься. Інженер перевірить живлення, продув і кабелі до замовлення, а не після.

Отримати консультацію