Одна карта дає 48 ГБ і живиться від 300 Вт, друга дає 96 ГБ і просить 600. Між ними одне покоління, подвоєна пам'ять, нова точність FP4 і корпус, який влізе не в кожну станцію. Розбираємо, за що тут реально доплачують і в яких задачах RTX 6000 Ada досі закриває питання.
Коротко
- 96 ГБ GDDR7 проти 48 ГБ GDDR6, пропускна здатність 1792 проти 960 ГБ/с
- 24 064 CUDA-ядра проти 18 176, FP32 126 проти 91,1 TFLOPS
- Тензорні ядра п'ятого покоління вміють FP4. В Ada стеля це FP8
- 600 Вт проти 300 Вт, плюс корпус на дюйм вищий і на півтора довший
- MIG ділить Blackwell на чотири інстанси по 24 ГБ. В Ada апаратного поділу немає взагалі
- Llama 3.3 70B у Q4 працює на одній карті: 27 токенів за секунду
Що змінилось за одне покоління
| Параметр | RTX 6000 Ada | RTX PRO 6000 Blackwell WS |
|---|---|---|
| Пам'ять | 48 ГБ GDDR6 з ECC | 96 ГБ GDDR7 з ECC |
| Шина пам'яті | 384 біт | 512 біт |
| Пропускна здатність | 960 ГБ/с | 1792 ГБ/с |
| CUDA-ядра | 18 176 | 24 064 |
| Тензорні / RT-ядра | 4-те і 3-тє покоління | 5-те і 4-те покоління |
| FP32 | 91,1 TFLOPS | 126 TFLOPS |
| RT Core | 210,6 TFLOPS | 382 TFLOPS |
| Пікова AI-цифра | 1457 ефективних FP8 TFLOPS з розрідженістю | 4000 AI TOPS у FP4 з розрідженістю |
| Системний інтерфейс | PCIe 4.0 ×16 | PCIe 5.0 ×16 |
| Дисплеї | 4× DisplayPort 1.4a | 4× DisplayPort 2.1b |
| Відеорушії | 3× NVENC, 3× NVDEC | 4× NVENC 9-го покоління, 4× NVDEC 6-го |
| MIG | немає | до 4×24 ГБ, 2×48 ГБ або 1×96 ГБ |
| TDP | 300 Вт | 600 Вт |
| Габарити, слоти | 4,4 × 10,5 дюйма, 2 слоти | 5,4 × 12 дюймів, 2 слоти |
| CUDA / Vulkan | 11.6 / 1.3 | 12.8 / 1.4 |
Джерела: даташит RTX 6000 Ada, даташит RTX PRO 6000 Blackwell Workstation Edition
FP32 виріс на 38%, RT Core на 81%, пропускна здатність пам'яті на 87%. Найважливіша тут остання цифра.
Пам'ять важить більше за ядра
У 48 ГБ модель на 70 мільярдів параметрів заходить хіба в агресивній квантизації і з коротким контекстом, а KV-кеш доводиться різати. У 96 ГБ та сама модель лягає в Q4 з робочим контекстом, і місце ще лишається. Заміри llama-bench на одному запиті, RTX PRO 6000:
| Модель | Читання запиту | Генерація |
|---|---|---|
| llama3.1 70B Q4_K_M | не наведено | 27 ток/с |
| qwen3-next 80B Q4_K_M | 3274 ток/с | 124 ток/с |
| qwen2.5 32B | не наведено | 56 ток/с |
| mistral-nemo 12B | 8325 ток/с | 158 ток/с |
Джерело: llama-bench на RTX PRO 6000, режим одного користувача
Тут є пастка, у яку регулярно потрапляють при плануванні бюджету. Дві RTX 6000 Ada не складаються в 96 ГБ: у даташиті навпроти NVLink стоїть просте «No», обмін іде через PCIe, і модель, яка не влізла в одну карту, доведеться різати по шарах із втратою швидкості. Практики формулюють користь другої карти інакше: тримати кілька спеціалізованих моделей одночасно, наприклад LLM, реранкер і модель ембедингів.
FP4 і тензорні ядра п'ятого покоління
FP4 удвічі економніший за FP8 по пам'яті, і саме звідси береться заявлений показник 4000 AI TOPS. У виносці даташита написано «effective FP4 TOPS with sparsity», тобто на щільній моделі без розрідженості цифра буде нижчою. Приріст від зниження точності теж приходить не звідти, звідки очікують: генерація токенів упирається у швидкість пам'яті, бо на кожен токен читаються всі ваги. Виграє та точність, яка робить модель фізично меншою.
Скільки тензорних ядер у карти, NVIDIA не пише. У даташиті Workstation Edition вказано лише покоління, а число 752 фігурує в огляді StorageReview і офіційного підтвердження не має. RT-ядер 188, це число збігається зі сторінкою Server Edition. У Ada все опубліковано чесно: 568 тензорних, 142 RT.
600 Вт: скільки коштує обмежити карту
Подвоєний TDP лякає більше, ніж треба. Ту саму карту прогнали з лімітом 600 і 300 Вт на llama.cpp:
| Показник | 600 Вт | 300 Вт |
|---|---|---|
| Llama 3.1 8B Q8, читання | 14 040 ток/с | 10 093 ток/с |
| Llama 3.1 8B Q8, генерація | 165,1 ток/с | 155,6 ток/с |
| Llama 3.3 70B Q8, читання | 1734,6 ток/с | 906,6 ток/с |
| Llama 3.3 70B Q8, генерація | 20,5 ток/с | 19,3 ток/с |
| Пікові TFLOPS за лімітом | 423,2 | 260,2 |
Половина ліміту потужності забирає близько 6% на генерації і майже вдвічі на читанні довгого запиту. Для чату різниця майже не помітна. Для RAG, агентів і роботи з великими документами помітна одразу, бо там час відповіді визначає саме фаза читання. Для тих, кому потрібні 96 ГБ у бюджеті 300 Вт, є Max-Q: та сама пам'ять GDDR7 з ECC у габаритах 4,4 × 10,5 дюйма, тобто в корпусі RTX 6000 Ada.
Чого Ada не вміла в принципі
MIG розрізає карту на ізольовані інстанси: чотири по 24 ГБ, два по 48 або один на всі 96. В Ada апаратного поділу немає взагалі, і єдиний шлях там це vGPU зі стелею 32 віртуальні машини на карту (16 у різнорозмірному режимі), причому ввімкнення vGPU вимикає фізичні відеовиходи RTX 6000 Ada. Це прописано виноскою в її ж даташиті.
З MIG на Blackwell історія неприємна. Роздрібні карти йшли з прошивкою 98.02.52.00.02, а MIG потребує щонайменше 98.02.55.00.00, і позиція NVIDIA була така: оновлення vBIOS має надати партнер, який продав карту. Питайте версію прошивки до оплати. Окремо: у Proxmox офіційно підтримується vGPU лише на Server Edition, Workstation Edition у цьому сценарії пролітає.
Що показують заміри
| Тест на RTX PRO 6000 Workstation | Результат |
|---|---|
| LM Studio, Llama 3.1 70B | 31,84 ток/с |
| LM Studio, GPT-OSS 120B | 163,1 ток/с |
| Stable Diffusion XL FP16 | 5,364 с на зображення |
| Stable Diffusion 1.5 INT8 | 0,395 с на зображення |
| Blender 4.4, сцена Monster | 7870 семплів/хв |
| V-Ray | 12 128 vpaths |
| Споживання системи під SDXL | 918,5 Вт середнє, 1036,3 Вт пік |
Цифри споживання зняті з усього тестового стенда, не з карти. Джерело: StorageReview
А тепер чесно про слабке місце всіх порівнянь цих двох карт. Парних замірів, де обидві карти прогнали одним білдом в один день, публічно мало, і майже всі вони про рендер, а не про LLM. У StorageReview такі пари є: Blender 4.4, сцена Monster, дає 7870 семплів/хв проти 5633 у RTX 6000 Ada, а V-Ray 12 128 vpaths проти 10 766. Виходить 40% приросту в одному тесті і 13% у другому на тому самому стенді, і це найчесніша відповідь на питання «наскільки швидше»: залежить від навантаження сильніше, ніж від покоління. Ще одна тверда точка для Ada є в огляді The Register: FLUX.1 Dev у BF16, 50 кроків, 1024×1024 займає на ній 37 секунд, а файнтюн Llama 3.2 3B на мільйоні токенів близько 30 секунд.
Чого не пишуть у презентаціях
NVLink у документації RTX PRO 6000 не згадується взагалі. Сторонні джерела кажуть, що його прибрали і все йде через PCIe Gen5, тобто дві карти знову ж таки не дадуть єдиного пулу на 192 ГБ. ECC на GDDR7 користувачі не змогли вимкнути: у попередніх поколіннях під рендер його відключали, тут команди nvidia-smi не дають ефекту. Офіційної відповіді NVIDIA в тій темі так і не з'явилось, скільки гігабайтів забирає ECC, теж ніхто не сказав.
Ранні драйвери додали роботи. Версія 575.51.03 віддавала «No devices were found», бо з Blackwell працює тільки відкритий модуль ядра. Далі була гілка Xid 119 з таймаутом GSP, де обидва випадки зрештою закінчились RMA, і окремо Xid 79 з падінням карти з шини вже на 580.159.03. Пара карт на деяких материнках вішала систему через 5-60 хвилин на PCIe Gen4, стабільність поверталась на Gen3, а лікувалось вмиканням PCIe Spread Spectrum. Карта не погана. Просто закладайте час на підбір прошивки, драйвера й материнської плати, а не ставте її в п'ятницю перед здачею проєкту.
Коли доплата виправдана, а коли Ada лишається розумною
Беріть Blackwell, якщо модель від 70 мільярдів параметрів або 30B із довгим контекстом, якщо потрібен MIG для поділу карти між командами, якщо у вас відеоконвеєр і чотири рушії NVENC дев'ятого покоління закривають реальний обсяг, якщо в задачі багато читання довгих запитів. І якщо станція вже має блок живлення з запасом, корпус під довшу карту і місце за нею для продуву.
Лишайтесь на Ada, якщо модель уже живе в 48 ГБ і рости не збирається, якщо парк станцій уніфікований і однакові драйвери для вас цінніші за приріст, якщо бюджет живлення в приміщенні зафіксований. Заміна 300 Вт на 600 тягне за собою новий блок, іноді новий корпус, а в складанні на кілька карт ще й окрему лінію на 20 ампер. І окремо: FP64 на цих картах фактично немає в жодного покоління, тому для математичного моделювання перехід на Blackwell не змінює нічого.
Що з цього є в нас
- RTX PRO 6000 Blackwell Workstation Edition 96 ГБ: 600 Вт, охолодження double-flow-through, є також версія OEM
- RTX PRO 6000 Blackwell Max-Q: ті самі 96 ГБ у бюджеті 300 Вт і в габаритах Ada
- RTX 6000 Ada 48 ГБ: активний кулер, 300 Вт, плюс варіант OEM
- RTX PRO 6000 Server Edition: пасивна, під серверне шасі, підтримка vGPU
- NVIDIA L40S 48 ГБ: той самий кристал, що в Ada, але для цілодобової роботи в стійці
Часті питання
Що дають дві карти проти однієї?
Не 192 ГБ. NVLink немає, пам'ять в один пул не збирається. Реальна користь: тримати кілька спеціалізованих моделей одночасно або паралелити рендер.
Чи запрацює MIG з коробки?
На роздрібних картах на старті продажів не працював. Потрібна прошивка щонайменше 98.02.55.00.00, а карти йшли з 98.02.52.00.02. Робочі конфігурації на форумі зафіксували на 98.02.81.00.07.
Чому карта тримає 450 Вт замість 600?
Ліміт задає sense-конфігурація кабелю 12VHPWR. У серверах Supermicro один артикул кабелю сконфігурований на 450 Вт, під 600 потрібен інший. У nvidia-smi це видно як Max Power Limit 450 Вт при мінімумі 300.
Чи вистачить лінії на 15 ампер?
На одну карту вистачить. На складання з кількох ні: у станції з чотирма Max-Q заміряли 1650-1800 Вт з розетки під повним навантаженням, і порада практиків це лінія на 20 ампер.
Чи можна вимкнути ECC під рендер?
На попередніх поколіннях вимикали. На GDDR7 користувачі повідомляють, що команди nvidia-smi нічого не роблять, а офіційного пояснення від NVIDIA у відповідній темі немає.
Взяти одну RTX PRO 6000 чи два DGX Spark?
Це вибір між 96 ГБ швидкої GDDR7 і 256 ГБ повільної уніфікованої пам'яті. На одному стенді LMSYS з моделлю gpt-oss 20B карта дала 215 токенів за секунду генерації, Spark 49,7.
Ці моделі є в каталозі
Не впевнені, чи потрібні саме 96 ГБ?
Напишіть, які моделі або сцени плануєте рахувати, скільки людей працюватиме з карткою і що вже стоїть у станції. Інженер порахує, чи вистачить RTX 6000 Ada, чи розумніше одразу брати Blackwell, і підбере блок живлення з корпусом.
Отримати консультацію


