Вопрос приходит примерно так: «взяли один DGX Spark, уперлись, брать второй?». Ответ зависит не от желания масштабироваться, а от того, во что именно вы уперлись. Если в объём памяти, второй узел поможет. Если в скорость генерации, он не поможет никак. Ниже цифры из официальных спецификаций, живые замеры из открытых тестов и место, где источники NVIDIA противоречат друг другу.

Коротко

  • Один Spark: 128 ГБ общей памяти, пропускная 273 ГБ/с, инференс моделей до 200 миллиардов параметров
  • Два узла сшиваются напрямую кабелем QSFP между портами ConnectX-7, без коммутатора
  • Паспортные 200 Гб/с получают не все: в открытых замерах выходило 92 до 95 Гб/с, пока линки не привязали правильно
  • Память удваивается, скорость генерации токенов нет: она держится на 273 ГБ/с каждого узла
  • Продуктовая страница NVIDIA обещает четыре системы, инструкция по эксплуатации называет три напрямую кабелями

Что умеет одна машина

DGX Spark построен на суперчипе GB10 Grace Blackwell: графическая часть Blackwell с тензорными ядрами пятого поколения плюс 20 ядер Arm, десять Cortex-X925 и десять Cortex-A725. Память одна на всех, 128 ГБ LPDDR5x, когерентная: процессор и графика видят один и тот же массив без копирования туда и обратно. Вычислительная заявка 1 петафлопс в формате FP4. Накопитель 4 ТБ NVMe с самошифрованием. Всё это в коробке 150 на 150 на 50,5 мм весом 1,2 кг, блок питания на 240 Вт, а сам GB10 держит 140 Вт.

Официальный предел для одной машины: тонкая настройка моделей до 70 миллиардов параметров и инференс до 200 миллиардов. Это не маркетинг, а то, что физически помещается в 128 ГБ при агрессивной квантизации.

Именно объём здесь главное преимущество. Модель, которая не влезет в 96 ГБ профессиональной карты, в Spark влезет, и для этого не нужны ни стойка, ни три фазы, ни отдельный канал охлаждения. Плата за это честная и известна заранее: LPDDR5x вместо HBM, то есть объём куплен ценой пропускной способности. Дальше о том, как именно это ощущается в работе.

Где оно упирается

В 273 ГБ/с. Это главное число, и оно объясняет все отзывы вида «модель загрузилась, но отвечает медленно». Генерация токенов это последовательное чтение весов модели из памяти на каждый токен. Сколько бы ни было вычислительной мощности, быстрее памяти оно не пойдёт.

Открытые замеры на llama.cpp показывают разрыв очень наглядно. GPT-OSS 120B в формате MXFP4: обработка запроса 1956 токенов в секунду, генерация ответа 60,6 токена в секунду. На контексте 32 тысячи токенов оба числа падают до 1027 и 40,6. То есть прочитать ваш запрос машина успевает мгновенно, а печатает ответ примерно со скоростью человеческого чтения вслух. Замеры команды LMSYS на стеке SGLang дают тот же порядок: около 70 токенов в секунду на модели 20B и около 50 на 120B.

Чем сшиваются два узла

В каждом Spark стоит ConnectX-7 с двумя портами QSFP по 200 Гб/с. Два узла соединяются напрямую, кабель из порта в порт, коммутатор не нужен. Официальный сценарий NVIDIA «Connect Two Sparks» описывает ровно это: физическое соединение, настройка сетевых интерфейсов через netplan, беспарольный SSH между узлами. На весь маршрут заложено около часа.

Кабель нужен конкретный: пассивный DAC QSFP112 длиной 0,5 м. NVIDIA перечисляет две валидированные модели, Amphenol NJAAKK-N911 и Luxshare LMTQF022-SD-R. Комплектный кабель PNY QSFP to QSFP 112G на 0,5 м сделан под ту же спецификацию, поэтому искать что-то длиннее или активное не надо. Полметра это не ошибка проектировщика: два корпуса стоят рядом на столе.

Сколько на самом деле даёт 200 Гб/с

Здесь начинается то, чего нет в рекламных материалах. В тестах ServeTheHome полные 185 до 190 Гб/с снимались только после того, как интерфейсы привязали к правильным 100-гигабитным MAC на одной из клеток QSFP. Пока привязка была произвольная, оба линка шли через один канал PCIe Gen5 x4 и давали 92 до 95 Гб/с. Половина паспортной цифры, и никакой ошибки в конфигурации при этом не видно: оно просто работает вдвое медленнее.

Практический вывод простой. Закладывайте в план день на настройку сети и проверяйте результат замерами RDMA, а не тем, что линк поднялся.

Сколько узлов можно связать: источники не сходятся

Продуктовая страница NVIDIA говорит: сеть позволяет соединить до четырёх систем DGX Spark и работать с моделями до 700 миллиардов параметров. Инструкция по эксплуатации того же продукта в разделе об объединении говорит другое: до трёх систем напрямую кабелями, четыре только через коммутатор. Оба документа официальные.

Отдельно о цифре, которая гуляет по обзорам: «два Spark тянут модель на 405 миллиардов параметров». В документах NVIDIA этого утверждения нет. Ни продуктовая страница, ни инструкция, ни официальный сценарий объединения двух машин таких моделей не называют. Если эта конфигурация критична для вашего проекта, её надо проверять на живом железе до покупки, а не принимать на веру.

Кому хватит одного

Одного хватит, если ваша модель помещается в 128 ГБ и вы разрабатываете, а не обслуживаете поток пользователей. Прототип, тонкая настройка модели до 70 миллиардов, локальный ассистент для команды, работа с чувствительными данными, которые нельзя отдавать в облако: всё это закрывается одной коробкой под столом, без стойки, без промышленной розетки и без отдельного кондиционера.

Второй узел имеет смысл в двух случаях. Первый: модель не влезает в 128 ГБ, и вам нужна именно память. Второй: вы осваиваете распределённое обучение как инженерную практику, и вам нужен настоящий второй узел с настоящим NCCL, а не имитация. В остальных случаях удвоение узлов даёт удвоение памяти и ноль прироста к скорости ответа, потому что каждый узел остаётся со своими 273 ГБ/с.

Если упирается именно скорость генерации, смотреть надо не в сторону второго Spark, а в сторону карт с памятью HBM, где пропускная измеряется тысячами гигабайт в секунду.

NVIDIA DGX Spark есть в наличии в Киеве. Самовывоз или отправка в день заказа, комплектный кабель для связки двух узлов заказывается отдельно.

Карточка DGX Spark с характеристиками или напишите нам, подберём конфигурацию под вашу модель.