Одна карта даёт 48 ГБ и питается от 300 Вт, вторая даёт 96 ГБ и просит 600. Между ними одно поколение, удвоенная память, новая точность FP4 и корпус, который влезет не в каждую станцию. Разбираем, за что здесь реально доплачивают и в каких задачах RTX 6000 Ada до сих пор закрывает вопрос.

Коротко

  • 96 ГБ GDDR7 против 48 ГБ GDDR6, пропускная способность 1792 против 960 ГБ/с
  • 24 064 CUDA-ядра против 18 176, FP32 126 против 91,1 TFLOPS
  • Тензорные ядра пятого поколения умеют FP4. У Ada потолок это FP8
  • 600 Вт против 300 Вт, плюс корпус на дюйм выше и на полтора длиннее
  • MIG делит Blackwell на четыре инстанса по 24 ГБ. У Ada аппаратного деления нет вообще
  • Llama 3.3 70B в Q4 работает на одной карте: 27 токенов в секунду

Что изменилось за одно поколение

Параметр RTX 6000 Ada RTX PRO 6000 Blackwell WS
Память 48 ГБ GDDR6 с ECC 96 ГБ GDDR7 с ECC
Шина памяти 384 бит 512 бит
Пропускная способность 960 ГБ/с 1792 ГБ/с
CUDA-ядра 18 176 24 064
Тензорные / RT-ядра 4-е и 3-е поколение 5-е и 4-е поколение
FP32 91,1 TFLOPS 126 TFLOPS
RT Core 210,6 TFLOPS 382 TFLOPS
Пиковая AI-цифра 1457 эффективных FP8 TFLOPS с разрежённостью 4000 AI TOPS в FP4 с разрежённостью
Системный интерфейс PCIe 4.0 ×16 PCIe 5.0 ×16
Дисплеи 4× DisplayPort 1.4a 4× DisplayPort 2.1b
Видеодвижки 3× NVENC, 3× NVDEC 4× NVENC 9-го поколения, 4× NVDEC 6-го
MIG нет до 4×24 ГБ, 2×48 ГБ или 1×96 ГБ
TDP 300 Вт 600 Вт
Габариты, слоты 4,4 × 10,5 дюйма, 2 слота 5,4 × 12 дюймов, 2 слота
CUDA / Vulkan 11.6 / 1.3 12.8 / 1.4

Источники: даташит RTX 6000 Ada, даташит RTX PRO 6000 Blackwell Workstation Edition

FP32 вырос на 38%, RT Core на 81%, пропускная способность памяти на 87%. Важнее всего здесь последняя цифра.

Память весит больше, чем ядра

В 48 ГБ модель на 70 миллиардов параметров заходит разве что в агрессивной квантизации и с коротким контекстом, а KV-кеш приходится резать. В 96 ГБ та же модель ложится в Q4 с рабочим контекстом, и место ещё остаётся. Замеры llama-bench на одном запросе, RTX PRO 6000:

Модель Чтение запроса Генерация
llama3.1 70B Q4_K_M не приведено 27 ток/с
qwen3-next 80B Q4_K_M 3274 ток/с 124 ток/с
qwen2.5 32B не приведено 56 ток/с
mistral-nemo 12B 8325 ток/с 158 ток/с

Источник: llama-bench на RTX PRO 6000, режим одного пользователя

Здесь есть ловушка, в которую регулярно попадают при планировании бюджета. Две RTX 6000 Ada не складываются в 96 ГБ: в даташите напротив NVLink стоит простое «No», обмен идёт через PCIe, и модель, которая не влезла в одну карту, придётся резать по слоям с потерей скорости. Практики формулируют пользу второй карты иначе: держать несколько специализированных моделей одновременно, например LLM, реранкер и модель эмбеддингов.

FP4 и тензорные ядра пятого поколения

FP4 вдвое экономнее FP8 по памяти, и именно отсюда берётся заявленный показатель 4000 AI TOPS. В сноске даташита написано «effective FP4 TOPS with sparsity», то есть на плотной модели без разрежённости цифра будет ниже. Прирост от снижения точности тоже приходит не оттуда, откуда его ждут: генерация токенов упирается в скорость памяти, потому что на каждый токен читаются все веса. Выигрывает та точность, которая делает модель физически меньше.

Сколько у карты тензорных ядер, NVIDIA не пишет. В даташите Workstation Edition указано только поколение, а число 752 фигурирует в обзоре StorageReview и официального подтверждения не имеет. RT-ядер 188, это число совпадает со страницей Server Edition. У Ada всё опубликовано честно: 568 тензорных, 142 RT.

600 Вт: сколько стоит ограничить карту

Удвоенный TDP пугает сильнее, чем следовало бы. Одну и ту же карту прогнали с лимитом 600 и 300 Вт на llama.cpp:

Показатель 600 Вт 300 Вт
Llama 3.1 8B Q8, чтение 14 040 ток/с 10 093 ток/с
Llama 3.1 8B Q8, генерация 165,1 ток/с 155,6 ток/с
Llama 3.3 70B Q8, чтение 1734,6 ток/с 906,6 ток/с
Llama 3.3 70B Q8, генерация 20,5 ток/с 19,3 ток/с
Пиковые TFLOPS по лимиту 423,2 260,2

Источник: замеры 600 Вт против 300 Вт на Level1Techs

Половина лимита мощности забирает около 6% на генерации и почти вдвое на чтении длинного запроса. Для чата разница почти не видна. Для RAG, агентов и работы с большими документами видна сразу, потому что там время ответа определяет именно фаза чтения. Тем, кому нужны 96 ГБ в бюджете 300 Вт, есть Max-Q: та же память GDDR7 с ECC в габаритах 4,4 × 10,5 дюйма, то есть в корпусе RTX 6000 Ada.

Чего Ada не умела в принципе

MIG разрезает карту на изолированные инстансы: четыре по 24 ГБ, два по 48 или один на все 96. У Ada аппаратного деления нет вообще, и единственный путь там это vGPU с потолком 32 виртуальные машины на карту (16 в разноразмерном режиме), причём включение vGPU выключает физические видеовыходы RTX 6000 Ada. Это прописано сноской в её же даташите.

С MIG на Blackwell история неприятная. Розничные карты шли с прошивкой 98.02.52.00.02, а MIG требует минимум 98.02.55.00.00, и позиция NVIDIA была такая: обновление vBIOS должен предоставить партнёр, который продал карту. Спрашивайте версию прошивки до оплаты. Отдельно: в Proxmox официально поддерживается vGPU только на Server Edition, Workstation Edition в этом сценарии пролетает.

Что показывают замеры

Тест на RTX PRO 6000 Workstation Результат
LM Studio, Llama 3.1 70B 31,84 ток/с
LM Studio, GPT-OSS 120B 163,1 ток/с
Stable Diffusion XL FP16 5,364 с на изображение
Stable Diffusion 1.5 INT8 0,395 с на изображение
Blender 4.4, сцена Monster 7870 семплов/мин
V-Ray 12 128 vpaths
Потребление системы под SDXL 918,5 Вт среднее, 1036,3 Вт пик

Цифры потребления сняты со всего тестового стенда, а не с карты. Источник: StorageReview

А теперь честно о слабом месте всех сравнений этих двух карт. Парных замеров, где обе карты прогнали одним билдом в один день, публично мало, и почти все они про рендер, а не про LLM. У StorageReview такие пары есть: Blender 4.4, сцена Monster, даёт 7870 семплов/мин против 5633 у RTX 6000 Ada, а V-Ray 12 128 vpaths против 10 766. Получается 40% прироста в одном тесте и 13% в другом на том же стенде, и это самый честный ответ на вопрос «насколько быстрее»: зависит от нагрузки сильнее, чем от поколения. Ещё одна твёрдая точка для Ada есть в обзоре The Register: FLUX.1 Dev в BF16, 50 шагов, 1024×1024 занимает на ней 37 секунд, а файнтюн Llama 3.2 3B на миллионе токенов около 30 секунд.

Чего не пишут в презентациях

NVLink в документации RTX PRO 6000 не упоминается вообще. Сторонние источники говорят, что его убрали и всё идёт через PCIe Gen5, то есть две карты опять же не дадут единого пула на 192 ГБ. ECC на GDDR7 пользователи не смогли выключить: на прошлых поколениях под рендер его отключали, здесь команды nvidia-smi не дают эффекта. Официального ответа NVIDIA в той теме так и не появилось, сколько гигабайт забирает ECC, тоже никто не сказал.

Ранние драйверы добавили работы. Версия 575.51.03 отдавала «No devices were found», потому что с Blackwell работает только открытый модуль ядра. Дальше была ветка Xid 119 с таймаутом GSP, где оба случая в итоге закончились RMA, и отдельно Xid 79 с падением карты с шины уже на 580.159.03. Пара карт на некоторых материнских платах вешала систему через 5-60 минут на PCIe Gen4, стабильность возвращалась на Gen3, а лечилось включением PCIe Spread Spectrum. Карта не плохая. Просто закладывайте время на подбор прошивки, драйвера и материнской платы, а не ставьте её в пятницу перед сдачей проекта.

Когда доплата оправдана, а когда Ada остаётся разумной

Берите Blackwell, если модель от 70 миллиардов параметров или 30B с длинным контекстом, если нужен MIG для деления карты между командами, если у вас видеоконвейер и четыре движка NVENC девятого поколения закрывают реальный объём, если в задаче много чтения длинных запросов. И если станция уже имеет блок питания с запасом, корпус под более длинную карту и место за ней для продува.

Оставайтесь на Ada, если модель уже живёт в 48 ГБ и расти не собирается, если парк станций унифицирован и одинаковые драйверы для вас ценнее прироста, если бюджет питания в помещении зафиксирован. Замена 300 Вт на 600 тянет за собой новый блок, иногда новый корпус, а в сборке на несколько карт ещё и отдельную линию на 20 ампер. И отдельно: FP64 на этих картах фактически нет ни у одного поколения, поэтому для математического моделирования переход на Blackwell не меняет ничего.

Что из этого есть у нас

Частые вопросы

Что дают две карты против одной?

Не 192 ГБ. NVLink нет, память в один пул не собирается. Реальная польза: держать несколько специализированных моделей одновременно или параллелить рендер.

Заработает ли MIG из коробки?

На розничных картах на старте продаж не работал. Нужна прошивка минимум 98.02.55.00.00, а карты шли с 98.02.52.00.02. Рабочие конфигурации на форуме зафиксировали на 98.02.81.00.07.

Почему карта держит 450 Вт вместо 600?

Лимит задаёт sense-конфигурация кабеля 12VHPWR. В серверах Supermicro один артикул кабеля сконфигурирован на 450 Вт, под 600 нужен другой. В nvidia-smi это видно как Max Power Limit 450 Вт при минимуме 300.

Хватит ли линии на 15 ампер?

На одну карту хватит. На сборку из нескольких нет: в станции с четырьмя Max-Q замеряли 1650-1800 Вт из розетки под полной нагрузкой, и совет практиков это линия на 20 ампер.

Можно ли выключить ECC под рендер?

На прошлых поколениях выключали. На GDDR7 пользователи сообщают, что команды nvidia-smi ничего не делают, а официального объяснения от NVIDIA в соответствующей теме нет.

Взять одну RTX PRO 6000 или два DGX Spark?

Это выбор между 96 ГБ быстрой GDDR7 и 256 ГБ медленной унифицированной памяти. На одном стенде LMSYS с моделью gpt-oss 20B карта дала 215 токенов в секунду генерации, Spark 49,7.

Не уверены, что нужны именно 96 ГБ?

Напишите, какие модели или сцены планируете считать, сколько людей будет работать с картой и что уже стоит в станции. Инженер посчитает, хватит ли RTX 6000 Ada или разумнее сразу брать Blackwell, и подберёт блок питания с корпусом.

Получить консультацию