Коробка размером с толстый роутер, 128 ГБ памяти, цена как у приличного автомобиля с вторичного рынка. NVIDIA продаёт DGX Spark как персональный суперкомпьютер для работы с большими моделями. Мы разобрались, что он тянет на самом деле и где цифры из презентации расходятся с тем, что видят люди у себя на столах.

Коротко

  • 128 ГБ унифицированной памяти, из них операционной системе видно около 119 ГиБ
  • Считает быстро, генерирует медленно: всё упирается в 273 ГБ/с пропускной способности
  • Dense-модель на 70 миллиардов параметров в режиме одного пользователя выдаёт 2,7 токена в секунду. Это не опечатка
  • Зато при 256 одновременных запросах gpt-oss 120B даёт 862 токена в секунду суммарно
  • Питание 240 Вт это рейтинг блока, сам GPU берёт максимум 120 Вт

Что внутри

В основе чип GB10 Grace Blackwell: двадцать ядер Arm (десять Cortex-X925 плюс десять Cortex-A725) и графическая часть Blackwell на 6144 CUDA-ядра с тензорными ядрами пятого поколения. Процессор и GPU связаны через NVLink-C2C и работают с общей когерентной памятью, так что данные не нужно копировать между системной памятью и видеопамятью.

Характеристика Значение
Чип GB10 Grace Blackwell, TDP 140 Вт
Процессор 20 ядер Arm: 10× Cortex-X925 + 10× Cortex-A725
CUDA-ядра 6144
Память 128 ГБ LPDDR5x, 256-битная шина, 16 каналов
Пропускная способность 273 ГБ/с
Накопитель 1 или 4 ТБ NVMe M.2 с самошифрованием
Сеть ConnectX-7, 200 Гбит/с, 2× QSFP, плюс 10 GbE RJ-45
Габариты и вес 150 × 150 × 50,5 мм, 1,2 кг
Операционная система NVIDIA DGX OS на базе Ubuntu 24.04, aarch64. Windows нет

Источники: страница продукта NVIDIA, аппаратная документация DGX Spark

Первое, с чем сталкиваются владельцы: вместо 128 ГБ система показывает около 119 ГиБ, то есть 122 570 МБ. Ничего не откусила операционка, это разница между гигабайтами производителя и гибибайтами, которыми считает Linux. NVIDIA вынесла объяснение в отдельную статью базы знаний, потому что вопрос задавали постоянно.

Главное ограничение, о котором не пишут в презентациях

Работа языковой модели делится на две фазы. Сначала она читает ваш запрос целиком (prefill), потом по одному генерирует токены ответа (decode). Первая фаза упирается в вычислительную мощность, вторая в скорость памяти: чтобы выдать один токен, надо прочитать все веса модели.

У Spark вычислительная часть сильная, а память на 273 ГБ/с. Отсюда почти все жалобы владельцев. Вот как это выглядит в цифрах на модели gpt-oss 120B:

Кто мерил и чем Чтение запроса Генерация
ServeTheHome, Ollama из коробки не мерили 14,5 ток/с
llama.cpp, формат MXFP4 1723 ток/с 38,6 ток/с
Level1Techs, llama.cpp MXFP4 не мерили 51,9 ток/с
NVIDIA официально, batch 1 1725 ток/с 55,4 ток/с

Разброс в 3,8 раза на одной модели. Причины: разные движки, разные форматы квантизации, разные даты замеров. Источники: ServeTheHome, Level1Techs, блог NVIDIA

Чтение запроса на скорости 1725 токенов в секунду это действительно быстро. Генерация на 55 токенов это примерно скорость человека, который читает вслух. Для чата нормально, для конвейерной обработки документов мало.

Число, которое лучше узнать до покупки

Люди берут 128 ГБ прежде всего ради 70-миллиардных моделей: в обычную видеокарту они не влезают. Команда LMSYS померила Llama 3.1 70B в формате FP8 на одном пользователе и получила 2,7 токена в секунду. На такой скорости ответ из трёхсот слов печатается полторы минуты.

Модель помещается в память и работает, вопрос только в том, готовы ли вы на это смотреть. Для ночной пакетной обработки приемлемо, для интерактива нет.

Причина снова в пропускной способности. Плотная модель на 70 миллиардов параметров в FP8 занимает около 70 ГБ, и каждый токен требует прочитать эти 70 ГБ. При 273 ГБ/с теоретический потолок выходит меньше четырёх токенов, и реальные 2,7 укладываются ровно в эту арифметику.

А теперь то, что меняет картину

Цифры выше относятся к одному пользователю. Когда запросов много, веса модели читаются один раз на всю пачку, и устройство раскрывается совсем иначе. Замеры Dendro Logic на vLLM:

Модель 1 запрос 64 запроса Пик
gpt-oss 120B MXFP4 33,5 373,3 862,8 при 256
Nemotron Super 49B NVFP4 5,8 не мерили 695,1 при 256
Nemotron Nano 9B v2 NVFP4 26,2 не мерили плато ~156 при 32

Источник: Dendro Logic, тест конкурентности на vLLM

Стодвадцатикратный прирост на Nemotron Super 49B это не опечатка. Именно здесь и живёт настоящее назначение устройства: его сделали обслуживать нагрузку, а не сидеть в чате с одним человеком. Если у вас отдел из пятнадцати разработчиков, которым нужен внутренний ассистент по коду, Spark справится. Если вы один и хотите самую большую модель лично для себя, деньги ушли не туда.

Питание: откуда взялись вопросы про «половину производительности»

На форуме NVIDIA есть показательная ветка с названием «Получаю половину заявленной производительности и упираюсь в 100 Вт». Человек решил, что ему продали брак.

Объяснение от NVIDIA простое: 240 Вт это рейтинг внешнего блока питания на пик. Графическая часть по спецификации берёт максимум 120 Вт, остальное уходит на процессор, сетевой чип ConnectX-7 и периферию. То есть 100 Вт на GPU под нагрузкой это штатное поведение, а не поломка. Заявленный петафлоп тоже требует уточнения: это FP4 с учётом разрежённости, и Wendell из Level1Techs пишет, что такие показатели достигаются всплесками по полсекунды.

Отдельная тема это потребление в простое. NVIDIA его не специфицирует вообще, хотя устройство покупают как всегда включённую рабочую станцию. Главным потребителем в простое оказался сетевой чип, часть проблемы закрыли обновлением прошивки.

Два узла: что это даёт и чего не даёт

Два Spark соединяются напрямую кабелем QSFP через ConnectX-7 и работают как один ресурс на 256 ГБ. NVIDIA заявляет поддержку моделей до 405 миллиардов параметров на такой связке, документация добавляет, что прямыми кабелями можно объединить до трёх систем, а через коммутатор до четырёх.

Чего ждать не надо: удвоения скорости. Замеры показывают, что фаза чтения запроса ускоряется от 6 до 25 процентов в зависимости от модели, а генерация не ускоряется вовсе или даже просаживается. Смысл связки в том, чтобы поместить модель побольше, а не быстрее получить ответ.

Кому подходит, а кому нет

Подходит, если вы разрабатываете под CUDA и вам нужна среда, идентичная продакшену, без счетов за облако каждый месяц. Если данные нельзя вывозить за периметр компании. Если надо обслуживать команду, а не одного человека. Если вы делаете файнтюн моделей до 70 миллиардов параметров методом QLoRA и готовы ждать.

Не подходит, если нужен быстрый интерактивный чат с самой большой моделью, какую удалось найти. Если вы работаете в Windows: система только Linux на архитектуре aarch64, и часть привычного софта под неё просто не собрана. Если вы рассчитываете на игры или классический рендер.

Что из этого есть у нас

Частые вопросы

Почему система показывает 119 ГБ вместо 128?

Это разница между гигабайтами и гибибайтами, а не расход операционной системы. Реально доступно 122 570 МБ. NVIDIA подтвердила это отдельной статьёй базы знаний.

Можно ли поставить Windows?

Нет. Устройство работает под DGX OS на базе Ubuntu 24.04 для архитектуры aarch64. Windows не поддерживается, и софт под ARM-Linux собран далеко не весь.

Какую розетку и какой ИБП закладывать?

Внешний блок питания на 240 Вт, обычной бытовой линии хватает с большим запасом. Это принципиальное отличие от рабочей станции с несколькими видеокартами, где под нагрузкой нужны отдельные 20 ампер.

Что нужно, чтобы соединить два устройства?

Кабель QSFP в QSFP на 112 Гбит/с, он подключается напрямую между портами ConnectX-7. Коммутатор нужен только когда узлов больше трёх. Более быстрый кабель выигрыша не даст: 200 Гбит/с на порт это аппаратный потолок.

Насколько он громкий?

Под полной нагрузкой слышно, в простое практически нет. Это настольное устройство, а не серверный узел с тонкими вентиляторами на 15 тысяч оборотов.

Не уверены, что Spark это именно ваш инструмент?

Расскажите, какие модели планируете запускать и сколько людей будет с ними работать. Инженер посчитает, хватит ли одного узла или выгоднее собрать станцию на RTX PRO 6000.

Получить консультацию