Одна карта дає 48 ГБ і живиться від 300 Вт, друга дає 96 ГБ і просить 600. Між ними одне покоління, подвоєна пам'ять, нова точність FP4 і корпус, який влізе не в кожну станцію. Розбираємо, за що тут реально доплачують і в яких задачах RTX 6000 Ada досі закриває питання.

Коротко

  • 96 ГБ GDDR7 проти 48 ГБ GDDR6, пропускна здатність 1792 проти 960 ГБ/с
  • 24 064 CUDA-ядра проти 18 176, FP32 126 проти 91,1 TFLOPS
  • Тензорні ядра п'ятого покоління вміють FP4. В Ada стеля це FP8
  • 600 Вт проти 300 Вт, плюс корпус на дюйм вищий і на півтора довший
  • MIG ділить Blackwell на чотири інстанси по 24 ГБ. В Ada апаратного поділу немає взагалі
  • Llama 3.3 70B у Q4 працює на одній карті: 27 токенів за секунду

Що змінилось за одне покоління

Параметр RTX 6000 Ada RTX PRO 6000 Blackwell WS
Пам'ять 48 ГБ GDDR6 з ECC 96 ГБ GDDR7 з ECC
Шина пам'яті 384 біт 512 біт
Пропускна здатність 960 ГБ/с 1792 ГБ/с
CUDA-ядра 18 176 24 064
Тензорні / RT-ядра 4-те і 3-тє покоління 5-те і 4-те покоління
FP32 91,1 TFLOPS 126 TFLOPS
RT Core 210,6 TFLOPS 382 TFLOPS
Пікова AI-цифра 1457 ефективних FP8 TFLOPS з розрідженістю 4000 AI TOPS у FP4 з розрідженістю
Системний інтерфейс PCIe 4.0 ×16 PCIe 5.0 ×16
Дисплеї 4× DisplayPort 1.4a 4× DisplayPort 2.1b
Відеорушії 3× NVENC, 3× NVDEC 4× NVENC 9-го покоління, 4× NVDEC 6-го
MIG немає до 4×24 ГБ, 2×48 ГБ або 1×96 ГБ
TDP 300 Вт 600 Вт
Габарити, слоти 4,4 × 10,5 дюйма, 2 слоти 5,4 × 12 дюймів, 2 слоти
CUDA / Vulkan 11.6 / 1.3 12.8 / 1.4

Джерела: даташит RTX 6000 Ada, даташит RTX PRO 6000 Blackwell Workstation Edition

FP32 виріс на 38%, RT Core на 81%, пропускна здатність пам'яті на 87%. Найважливіша тут остання цифра.

Пам'ять важить більше за ядра

У 48 ГБ модель на 70 мільярдів параметрів заходить хіба в агресивній квантизації і з коротким контекстом, а KV-кеш доводиться різати. У 96 ГБ та сама модель лягає в Q4 з робочим контекстом, і місце ще лишається. Заміри llama-bench на одному запиті, RTX PRO 6000:

Модель Читання запиту Генерація
llama3.1 70B Q4_K_M не наведено 27 ток/с
qwen3-next 80B Q4_K_M 3274 ток/с 124 ток/с
qwen2.5 32B не наведено 56 ток/с
mistral-nemo 12B 8325 ток/с 158 ток/с

Джерело: llama-bench на RTX PRO 6000, режим одного користувача

Тут є пастка, у яку регулярно потрапляють при плануванні бюджету. Дві RTX 6000 Ada не складаються в 96 ГБ: у даташиті навпроти NVLink стоїть просте «No», обмін іде через PCIe, і модель, яка не влізла в одну карту, доведеться різати по шарах із втратою швидкості. Практики формулюють користь другої карти інакше: тримати кілька спеціалізованих моделей одночасно, наприклад LLM, реранкер і модель ембедингів.

FP4 і тензорні ядра п'ятого покоління

FP4 удвічі економніший за FP8 по пам'яті, і саме звідси береться заявлений показник 4000 AI TOPS. У виносці даташита написано «effective FP4 TOPS with sparsity», тобто на щільній моделі без розрідженості цифра буде нижчою. Приріст від зниження точності теж приходить не звідти, звідки очікують: генерація токенів упирається у швидкість пам'яті, бо на кожен токен читаються всі ваги. Виграє та точність, яка робить модель фізично меншою.

Скільки тензорних ядер у карти, NVIDIA не пише. У даташиті Workstation Edition вказано лише покоління, а число 752 фігурує в огляді StorageReview і офіційного підтвердження не має. RT-ядер 188, це число збігається зі сторінкою Server Edition. У Ada все опубліковано чесно: 568 тензорних, 142 RT.

600 Вт: скільки коштує обмежити карту

Подвоєний TDP лякає більше, ніж треба. Ту саму карту прогнали з лімітом 600 і 300 Вт на llama.cpp:

Показник 600 Вт 300 Вт
Llama 3.1 8B Q8, читання 14 040 ток/с 10 093 ток/с
Llama 3.1 8B Q8, генерація 165,1 ток/с 155,6 ток/с
Llama 3.3 70B Q8, читання 1734,6 ток/с 906,6 ток/с
Llama 3.3 70B Q8, генерація 20,5 ток/с 19,3 ток/с
Пікові TFLOPS за лімітом 423,2 260,2

Джерело: заміри 600 Вт проти 300 Вт на Level1Techs

Половина ліміту потужності забирає близько 6% на генерації і майже вдвічі на читанні довгого запиту. Для чату різниця майже не помітна. Для RAG, агентів і роботи з великими документами помітна одразу, бо там час відповіді визначає саме фаза читання. Для тих, кому потрібні 96 ГБ у бюджеті 300 Вт, є Max-Q: та сама пам'ять GDDR7 з ECC у габаритах 4,4 × 10,5 дюйма, тобто в корпусі RTX 6000 Ada.

Чого Ada не вміла в принципі

MIG розрізає карту на ізольовані інстанси: чотири по 24 ГБ, два по 48 або один на всі 96. В Ada апаратного поділу немає взагалі, і єдиний шлях там це vGPU зі стелею 32 віртуальні машини на карту (16 у різнорозмірному режимі), причому ввімкнення vGPU вимикає фізичні відеовиходи RTX 6000 Ada. Це прописано виноскою в її ж даташиті.

З MIG на Blackwell історія неприємна. Роздрібні карти йшли з прошивкою 98.02.52.00.02, а MIG потребує щонайменше 98.02.55.00.00, і позиція NVIDIA була така: оновлення vBIOS має надати партнер, який продав карту. Питайте версію прошивки до оплати. Окремо: у Proxmox офіційно підтримується vGPU лише на Server Edition, Workstation Edition у цьому сценарії пролітає.

Що показують заміри

Тест на RTX PRO 6000 Workstation Результат
LM Studio, Llama 3.1 70B 31,84 ток/с
LM Studio, GPT-OSS 120B 163,1 ток/с
Stable Diffusion XL FP16 5,364 с на зображення
Stable Diffusion 1.5 INT8 0,395 с на зображення
Blender 4.4, сцена Monster 7870 семплів/хв
V-Ray 12 128 vpaths
Споживання системи під SDXL 918,5 Вт середнє, 1036,3 Вт пік

Цифри споживання зняті з усього тестового стенда, не з карти. Джерело: StorageReview

А тепер чесно про слабке місце всіх порівнянь цих двох карт. Парних замірів, де обидві карти прогнали одним білдом в один день, публічно мало, і майже всі вони про рендер, а не про LLM. У StorageReview такі пари є: Blender 4.4, сцена Monster, дає 7870 семплів/хв проти 5633 у RTX 6000 Ada, а V-Ray 12 128 vpaths проти 10 766. Виходить 40% приросту в одному тесті і 13% у другому на тому самому стенді, і це найчесніша відповідь на питання «наскільки швидше»: залежить від навантаження сильніше, ніж від покоління. Ще одна тверда точка для Ada є в огляді The Register: FLUX.1 Dev у BF16, 50 кроків, 1024×1024 займає на ній 37 секунд, а файнтюн Llama 3.2 3B на мільйоні токенів близько 30 секунд.

Чого не пишуть у презентаціях

NVLink у документації RTX PRO 6000 не згадується взагалі. Сторонні джерела кажуть, що його прибрали і все йде через PCIe Gen5, тобто дві карти знову ж таки не дадуть єдиного пулу на 192 ГБ. ECC на GDDR7 користувачі не змогли вимкнути: у попередніх поколіннях під рендер його відключали, тут команди nvidia-smi не дають ефекту. Офіційної відповіді NVIDIA в тій темі так і не з'явилось, скільки гігабайтів забирає ECC, теж ніхто не сказав.

Ранні драйвери додали роботи. Версія 575.51.03 віддавала «No devices were found», бо з Blackwell працює тільки відкритий модуль ядра. Далі була гілка Xid 119 з таймаутом GSP, де обидва випадки зрештою закінчились RMA, і окремо Xid 79 з падінням карти з шини вже на 580.159.03. Пара карт на деяких материнках вішала систему через 5-60 хвилин на PCIe Gen4, стабільність поверталась на Gen3, а лікувалось вмиканням PCIe Spread Spectrum. Карта не погана. Просто закладайте час на підбір прошивки, драйвера й материнської плати, а не ставте її в п'ятницю перед здачею проєкту.

Коли доплата виправдана, а коли Ada лишається розумною

Беріть Blackwell, якщо модель від 70 мільярдів параметрів або 30B із довгим контекстом, якщо потрібен MIG для поділу карти між командами, якщо у вас відеоконвеєр і чотири рушії NVENC дев'ятого покоління закривають реальний обсяг, якщо в задачі багато читання довгих запитів. І якщо станція вже має блок живлення з запасом, корпус під довшу карту і місце за нею для продуву.

Лишайтесь на Ada, якщо модель уже живе в 48 ГБ і рости не збирається, якщо парк станцій уніфікований і однакові драйвери для вас цінніші за приріст, якщо бюджет живлення в приміщенні зафіксований. Заміна 300 Вт на 600 тягне за собою новий блок, іноді новий корпус, а в складанні на кілька карт ще й окрему лінію на 20 ампер. І окремо: FP64 на цих картах фактично немає в жодного покоління, тому для математичного моделювання перехід на Blackwell не змінює нічого.

Що з цього є в нас

Часті питання

Що дають дві карти проти однієї?

Не 192 ГБ. NVLink немає, пам'ять в один пул не збирається. Реальна користь: тримати кілька спеціалізованих моделей одночасно або паралелити рендер.

Чи запрацює MIG з коробки?

На роздрібних картах на старті продажів не працював. Потрібна прошивка щонайменше 98.02.55.00.00, а карти йшли з 98.02.52.00.02. Робочі конфігурації на форумі зафіксували на 98.02.81.00.07.

Чому карта тримає 450 Вт замість 600?

Ліміт задає sense-конфігурація кабелю 12VHPWR. У серверах Supermicro один артикул кабелю сконфігурований на 450 Вт, під 600 потрібен інший. У nvidia-smi це видно як Max Power Limit 450 Вт при мінімумі 300.

Чи вистачить лінії на 15 ампер?

На одну карту вистачить. На складання з кількох ні: у станції з чотирма Max-Q заміряли 1650-1800 Вт з розетки під повним навантаженням, і порада практиків це лінія на 20 ампер.

Чи можна вимкнути ECC під рендер?

На попередніх поколіннях вимикали. На GDDR7 користувачі повідомляють, що команди nvidia-smi нічого не роблять, а офіційного пояснення від NVIDIA у відповідній темі немає.

Взяти одну RTX PRO 6000 чи два DGX Spark?

Це вибір між 96 ГБ швидкої GDDR7 і 256 ГБ повільної уніфікованої пам'яті. На одному стенді LMSYS з моделлю gpt-oss 20B карта дала 215 токенів за секунду генерації, Spark 49,7.

Не впевнені, чи потрібні саме 96 ГБ?

Напишіть, які моделі або сцени плануєте рахувати, скільки людей працюватиме з карткою і що вже стоїть у станції. Інженер порахує, чи вистачить RTX 6000 Ada, чи розумніше одразу брати Blackwell, і підбере блок живлення з корпусом.

Отримати консультацію