Одна карта даёт 48 ГБ и питается от 300 Вт, вторая даёт 96 ГБ и просит 600. Между ними одно поколение, удвоенная память, новая точность FP4 и корпус, который влезет не в каждую станцию. Разбираем, за что здесь реально доплачивают и в каких задачах RTX 6000 Ada до сих пор закрывает вопрос.
Коротко
- 96 ГБ GDDR7 против 48 ГБ GDDR6, пропускная способность 1792 против 960 ГБ/с
- 24 064 CUDA-ядра против 18 176, FP32 126 против 91,1 TFLOPS
- Тензорные ядра пятого поколения умеют FP4. У Ada потолок это FP8
- 600 Вт против 300 Вт, плюс корпус на дюйм выше и на полтора длиннее
- MIG делит Blackwell на четыре инстанса по 24 ГБ. У Ada аппаратного деления нет вообще
- Llama 3.3 70B в Q4 работает на одной карте: 27 токенов в секунду
Что изменилось за одно поколение
| Параметр | RTX 6000 Ada | RTX PRO 6000 Blackwell WS |
|---|---|---|
| Память | 48 ГБ GDDR6 с ECC | 96 ГБ GDDR7 с ECC |
| Шина памяти | 384 бит | 512 бит |
| Пропускная способность | 960 ГБ/с | 1792 ГБ/с |
| CUDA-ядра | 18 176 | 24 064 |
| Тензорные / RT-ядра | 4-е и 3-е поколение | 5-е и 4-е поколение |
| FP32 | 91,1 TFLOPS | 126 TFLOPS |
| RT Core | 210,6 TFLOPS | 382 TFLOPS |
| Пиковая AI-цифра | 1457 эффективных FP8 TFLOPS с разрежённостью | 4000 AI TOPS в FP4 с разрежённостью |
| Системный интерфейс | PCIe 4.0 ×16 | PCIe 5.0 ×16 |
| Дисплеи | 4× DisplayPort 1.4a | 4× DisplayPort 2.1b |
| Видеодвижки | 3× NVENC, 3× NVDEC | 4× NVENC 9-го поколения, 4× NVDEC 6-го |
| MIG | нет | до 4×24 ГБ, 2×48 ГБ или 1×96 ГБ |
| TDP | 300 Вт | 600 Вт |
| Габариты, слоты | 4,4 × 10,5 дюйма, 2 слота | 5,4 × 12 дюймов, 2 слота |
| CUDA / Vulkan | 11.6 / 1.3 | 12.8 / 1.4 |
Источники: даташит RTX 6000 Ada, даташит RTX PRO 6000 Blackwell Workstation Edition
FP32 вырос на 38%, RT Core на 81%, пропускная способность памяти на 87%. Важнее всего здесь последняя цифра.
Память весит больше, чем ядра
В 48 ГБ модель на 70 миллиардов параметров заходит разве что в агрессивной квантизации и с коротким контекстом, а KV-кеш приходится резать. В 96 ГБ та же модель ложится в Q4 с рабочим контекстом, и место ещё остаётся. Замеры llama-bench на одном запросе, RTX PRO 6000:
| Модель | Чтение запроса | Генерация |
|---|---|---|
| llama3.1 70B Q4_K_M | не приведено | 27 ток/с |
| qwen3-next 80B Q4_K_M | 3274 ток/с | 124 ток/с |
| qwen2.5 32B | не приведено | 56 ток/с |
| mistral-nemo 12B | 8325 ток/с | 158 ток/с |
Источник: llama-bench на RTX PRO 6000, режим одного пользователя
Здесь есть ловушка, в которую регулярно попадают при планировании бюджета. Две RTX 6000 Ada не складываются в 96 ГБ: в даташите напротив NVLink стоит простое «No», обмен идёт через PCIe, и модель, которая не влезла в одну карту, придётся резать по слоям с потерей скорости. Практики формулируют пользу второй карты иначе: держать несколько специализированных моделей одновременно, например LLM, реранкер и модель эмбеддингов.
FP4 и тензорные ядра пятого поколения
FP4 вдвое экономнее FP8 по памяти, и именно отсюда берётся заявленный показатель 4000 AI TOPS. В сноске даташита написано «effective FP4 TOPS with sparsity», то есть на плотной модели без разрежённости цифра будет ниже. Прирост от снижения точности тоже приходит не оттуда, откуда его ждут: генерация токенов упирается в скорость памяти, потому что на каждый токен читаются все веса. Выигрывает та точность, которая делает модель физически меньше.
Сколько у карты тензорных ядер, NVIDIA не пишет. В даташите Workstation Edition указано только поколение, а число 752 фигурирует в обзоре StorageReview и официального подтверждения не имеет. RT-ядер 188, это число совпадает со страницей Server Edition. У Ada всё опубликовано честно: 568 тензорных, 142 RT.
600 Вт: сколько стоит ограничить карту
Удвоенный TDP пугает сильнее, чем следовало бы. Одну и ту же карту прогнали с лимитом 600 и 300 Вт на llama.cpp:
| Показатель | 600 Вт | 300 Вт |
|---|---|---|
| Llama 3.1 8B Q8, чтение | 14 040 ток/с | 10 093 ток/с |
| Llama 3.1 8B Q8, генерация | 165,1 ток/с | 155,6 ток/с |
| Llama 3.3 70B Q8, чтение | 1734,6 ток/с | 906,6 ток/с |
| Llama 3.3 70B Q8, генерация | 20,5 ток/с | 19,3 ток/с |
| Пиковые TFLOPS по лимиту | 423,2 | 260,2 |
Половина лимита мощности забирает около 6% на генерации и почти вдвое на чтении длинного запроса. Для чата разница почти не видна. Для RAG, агентов и работы с большими документами видна сразу, потому что там время ответа определяет именно фаза чтения. Тем, кому нужны 96 ГБ в бюджете 300 Вт, есть Max-Q: та же память GDDR7 с ECC в габаритах 4,4 × 10,5 дюйма, то есть в корпусе RTX 6000 Ada.
Чего Ada не умела в принципе
MIG разрезает карту на изолированные инстансы: четыре по 24 ГБ, два по 48 или один на все 96. У Ada аппаратного деления нет вообще, и единственный путь там это vGPU с потолком 32 виртуальные машины на карту (16 в разноразмерном режиме), причём включение vGPU выключает физические видеовыходы RTX 6000 Ada. Это прописано сноской в её же даташите.
С MIG на Blackwell история неприятная. Розничные карты шли с прошивкой 98.02.52.00.02, а MIG требует минимум 98.02.55.00.00, и позиция NVIDIA была такая: обновление vBIOS должен предоставить партнёр, который продал карту. Спрашивайте версию прошивки до оплаты. Отдельно: в Proxmox официально поддерживается vGPU только на Server Edition, Workstation Edition в этом сценарии пролетает.
Что показывают замеры
| Тест на RTX PRO 6000 Workstation | Результат |
|---|---|
| LM Studio, Llama 3.1 70B | 31,84 ток/с |
| LM Studio, GPT-OSS 120B | 163,1 ток/с |
| Stable Diffusion XL FP16 | 5,364 с на изображение |
| Stable Diffusion 1.5 INT8 | 0,395 с на изображение |
| Blender 4.4, сцена Monster | 7870 семплов/мин |
| V-Ray | 12 128 vpaths |
| Потребление системы под SDXL | 918,5 Вт среднее, 1036,3 Вт пик |
Цифры потребления сняты со всего тестового стенда, а не с карты. Источник: StorageReview
А теперь честно о слабом месте всех сравнений этих двух карт. Парных замеров, где обе карты прогнали одним билдом в один день, публично мало, и почти все они про рендер, а не про LLM. У StorageReview такие пары есть: Blender 4.4, сцена Monster, даёт 7870 семплов/мин против 5633 у RTX 6000 Ada, а V-Ray 12 128 vpaths против 10 766. Получается 40% прироста в одном тесте и 13% в другом на том же стенде, и это самый честный ответ на вопрос «насколько быстрее»: зависит от нагрузки сильнее, чем от поколения. Ещё одна твёрдая точка для Ada есть в обзоре The Register: FLUX.1 Dev в BF16, 50 шагов, 1024×1024 занимает на ней 37 секунд, а файнтюн Llama 3.2 3B на миллионе токенов около 30 секунд.
Чего не пишут в презентациях
NVLink в документации RTX PRO 6000 не упоминается вообще. Сторонние источники говорят, что его убрали и всё идёт через PCIe Gen5, то есть две карты опять же не дадут единого пула на 192 ГБ. ECC на GDDR7 пользователи не смогли выключить: на прошлых поколениях под рендер его отключали, здесь команды nvidia-smi не дают эффекта. Официального ответа NVIDIA в той теме так и не появилось, сколько гигабайт забирает ECC, тоже никто не сказал.
Ранние драйверы добавили работы. Версия 575.51.03 отдавала «No devices were found», потому что с Blackwell работает только открытый модуль ядра. Дальше была ветка Xid 119 с таймаутом GSP, где оба случая в итоге закончились RMA, и отдельно Xid 79 с падением карты с шины уже на 580.159.03. Пара карт на некоторых материнских платах вешала систему через 5-60 минут на PCIe Gen4, стабильность возвращалась на Gen3, а лечилось включением PCIe Spread Spectrum. Карта не плохая. Просто закладывайте время на подбор прошивки, драйвера и материнской платы, а не ставьте её в пятницу перед сдачей проекта.
Когда доплата оправдана, а когда Ada остаётся разумной
Берите Blackwell, если модель от 70 миллиардов параметров или 30B с длинным контекстом, если нужен MIG для деления карты между командами, если у вас видеоконвейер и четыре движка NVENC девятого поколения закрывают реальный объём, если в задаче много чтения длинных запросов. И если станция уже имеет блок питания с запасом, корпус под более длинную карту и место за ней для продува.
Оставайтесь на Ada, если модель уже живёт в 48 ГБ и расти не собирается, если парк станций унифицирован и одинаковые драйверы для вас ценнее прироста, если бюджет питания в помещении зафиксирован. Замена 300 Вт на 600 тянет за собой новый блок, иногда новый корпус, а в сборке на несколько карт ещё и отдельную линию на 20 ампер. И отдельно: FP64 на этих картах фактически нет ни у одного поколения, поэтому для математического моделирования переход на Blackwell не меняет ничего.
Что из этого есть у нас
- RTX PRO 6000 Blackwell Workstation Edition 96 ГБ: 600 Вт, охлаждение double-flow-through, есть также версия OEM
- RTX PRO 6000 Blackwell Max-Q: те же 96 ГБ в бюджете 300 Вт и в габаритах Ada
- RTX 6000 Ada 48 ГБ: активный кулер, 300 Вт, плюс вариант OEM
- RTX PRO 6000 Server Edition: пассивная, под серверное шасси, поддержка vGPU
- NVIDIA L40S 48 ГБ: тот же кристалл, что в Ada, но для круглосуточной работы в стойке
Частые вопросы
Что дают две карты против одной?
Не 192 ГБ. NVLink нет, память в один пул не собирается. Реальная польза: держать несколько специализированных моделей одновременно или параллелить рендер.
Заработает ли MIG из коробки?
На розничных картах на старте продаж не работал. Нужна прошивка минимум 98.02.55.00.00, а карты шли с 98.02.52.00.02. Рабочие конфигурации на форуме зафиксировали на 98.02.81.00.07.
Почему карта держит 450 Вт вместо 600?
Лимит задаёт sense-конфигурация кабеля 12VHPWR. В серверах Supermicro один артикул кабеля сконфигурирован на 450 Вт, под 600 нужен другой. В nvidia-smi это видно как Max Power Limit 450 Вт при минимуме 300.
Хватит ли линии на 15 ампер?
На одну карту хватит. На сборку из нескольких нет: в станции с четырьмя Max-Q замеряли 1650-1800 Вт из розетки под полной нагрузкой, и совет практиков это линия на 20 ампер.
Можно ли выключить ECC под рендер?
На прошлых поколениях выключали. На GDDR7 пользователи сообщают, что команды nvidia-smi ничего не делают, а официального объяснения от NVIDIA в соответствующей теме нет.
Взять одну RTX PRO 6000 или два DGX Spark?
Это выбор между 96 ГБ быстрой GDDR7 и 256 ГБ медленной унифицированной памяти. На одном стенде LMSYS с моделью gpt-oss 20B карта дала 215 токенов в секунду генерации, Spark 49,7.
Эти модели есть в каталоге
Не уверены, что нужны именно 96 ГБ?
Напишите, какие модели или сцены планируете считать, сколько людей будет работать с картой и что уже стоит в станции. Инженер посчитает, хватит ли RTX 6000 Ada или разумнее сразу брать Blackwell, и подберёт блок питания с корпусом.
Получить консультацию


