Коробка розміром із товстий роутер, 128 ГБ пам'яті, ціна як у пристойного автомобіля на вторинці. NVIDIA продає DGX Spark як персональний суперкомп'ютер для роботи з великими моделями. Ми розібрались, що він тягне насправді, а де цифри з презентації розходяться з тим, що бачать люди на своїх столах.
Коротко
- 128 ГБ уніфікованої пам'яті, з них операційній системі видно близько 119 ГіБ
- Рахує швидко, генерує повільно: усе впирається в 273 ГБ/с пропускної здатності
- Dense-модель на 70 мільярдів параметрів у режимі одного користувача видає 2,7 токена за секунду. Це не помилка
- Зате при 256 одночасних запитах gpt-oss 120B дає 862 токени за секунду сумарно
- Живлення 240 Вт це рейтинг блока, сам GPU бере максимум 120 Вт
Що всередині
В основі чип GB10 Grace Blackwell: двадцять ядер Arm (десять Cortex-X925 плюс десять Cortex-A725) і графічна частина Blackwell на 6144 CUDA-ядра з тензорними ядрами п'ятого покоління. Процесор і GPU з'єднані через NVLink-C2C і працюють зі спільною когерентною пам'яттю, тобто дані не треба копіювати між системною та відеопам'яттю.
| Характеристика | Значення |
|---|---|
| Чип | GB10 Grace Blackwell, TDP 140 Вт |
| Процесор | 20 ядер Arm: 10× Cortex-X925 + 10× Cortex-A725 |
| CUDA-ядра | 6144 |
| Пам'ять | 128 ГБ LPDDR5x, 256-бітна шина, 16 каналів |
| Пропускна здатність | 273 ГБ/с |
| Накопичувач | 1 або 4 ТБ NVMe M.2 із самошифруванням |
| Мережа | ConnectX-7, 200 Гбіт/с, 2× QSFP, плюс 10 GbE RJ-45 |
| Габарити й вага | 150 × 150 × 50,5 мм, 1,2 кг |
| Операційна система | NVIDIA DGX OS на базі Ubuntu 24.04, aarch64. Windows немає |
Джерела: сторінка продукту NVIDIA, апаратна документація DGX Spark
Перше, з чим стикаються власники: замість 128 ГБ система показує близько 119 ГіБ, тобто 122 570 МБ. Це не відкушено операційкою, це різниця між гігабайтами виробника і гібібайтами, якими рахує Linux. NVIDIA винесла пояснення в окрему статтю бази знань, бо питання ставили постійно.
Головне обмеження, про яке не пишуть у презентаціях
Робота мовної моделі ділиться на дві фази. Спочатку вона читає ваш запит цілком (prefill), потім по одному генерує токени відповіді (decode). Перша фаза впирається в обчислювальну потужність, друга в швидкість пам'яті: щоб видати один токен, треба прочитати всі ваги моделі.
У Spark обчислювальна частина сильна, а пам'ять на 273 ГБ/с. Звідси майже всі скарги власників. Ось як це виглядає в цифрах на моделі gpt-oss 120B:
| Хто міряв і чим | Читання запиту | Генерація |
|---|---|---|
| ServeTheHome, Ollama з коробки | не міряли | 14,5 ток/с |
| llama.cpp, формат MXFP4 | 1723 ток/с | 38,6 ток/с |
| Level1Techs, llama.cpp MXFP4 | не міряли | 51,9 ток/с |
| NVIDIA офіційно, batch 1 | 1725 ток/с | 55,4 ток/с |
Розкид у 3,8 раза на одній моделі. Причини: різні рушії, різні формати квантизації, різні дати замірів. Джерела: ServeTheHome, Level1Techs, блог NVIDIA
Читання запиту на швидкості 1725 токенів за секунду це справді швидко. Генерація на 55 токенів це приблизно швидкість читання людини вголос. Для чату нормально, для конвеєрної обробки документів замало.
Число, яке варто знати до покупки
Люди купують 128 ГБ передусім заради 70-мільярдних моделей: у звичайну відеокарту вони не влазять. Команда LMSYS поміряла Llama 3.1 70B у форматі FP8 на одному користувачі й отримала 2,7 токена за секунду. Це рівень, на якому відповідь із трьохсот слів друкується півтори хвилини.
Модель поміщається в пам'ять і працює, питання лише в тому, чи готові ви на неї дивитись. Для нічної пакетної обробки прийнятно, для інтерактиву ні.
Причина знову в пропускній здатності. Щільна модель на 70 мільярдів параметрів у FP8 займає близько 70 ГБ, і кожен токен вимагає прочитати ці 70 ГБ. При 273 ГБ/с теоретична стеля виходить менш ніж чотири токени, і реальні 2,7 укладаються рівно в цю арифметику.
А тепер те, що змінює картину
Наведені вище цифри стосуються одного користувача. Коли запитів багато, ваги моделі читаються один раз на цілу пачку, і пристрій розкривається зовсім інакше. Заміри Dendro Logic на vLLM:
| Модель | 1 запит | 64 запити | Пік |
|---|---|---|---|
| gpt-oss 120B MXFP4 | 33,5 | 373,3 | 862,8 при 256 |
| Nemotron Super 49B NVFP4 | 5,8 | не міряли | 695,1 при 256 |
| Nemotron Nano 9B v2 NVFP4 | 26,2 | не міряли | плато ~156 при 32 |
Сто двадцятикратний приріст на Nemotron Super 49B це не помилка друку. Саме тут і живе справжнє призначення пристрою: він створений обслуговувати навантаження, а не сидіти в чаті з однією людиною. Якщо у вас відділ з п'ятнадцяти розробників, яким потрібен внутрішній асистент по коду, Spark справиться. Якщо ви один і хочете найбільшу модель для себе, гроші витрачені не туди.
Живлення: звідки взялись питання про «половину продуктивності»
На форумі NVIDIA є показова гілка з назвою «Отримую половину заявленої продуктивності й упираюсь у 100 Вт». Людина вирішила, що їй продали бракований пристрій.
Пояснення від NVIDIA просте: 240 Вт це рейтинг зовнішнього блока живлення на пік. Графічна частина за специфікацією бере максимум 120 Вт, решта йде на процесор, мережевий чип ConnectX-7 і периферію. Тобто 100 Вт на GPU під навантаженням це штатна поведінка, а не поломка. Заявлений петафлоп теж вимагає уточнення: це FP4 з урахуванням розрідженості, і Wendell з Level1Techs зазначає, що такі показники досягаються сплесками по пів секунди.
Окрема тема це споживання в простої. NVIDIA його не специфікує взагалі, хоча пристрій купують як завжди увімкнену робочу станцію. Головним споживачем у простої виявився мережевий чип, частину проблеми закрили оновленням прошивки.
Два вузли: що це дає і чого не дає
Два Spark з'єднуються напряму кабелем QSFP через ConnectX-7 і працюють як один ресурс на 256 ГБ. NVIDIA заявляє підтримку моделей до 405 мільярдів параметрів на такій зв'язці, документація додає, що прямими кабелями можна об'єднати до трьох систем, а через комутатор до чотирьох.
Чого чекати не варто: подвоєння швидкості. Заміри показують, що фаза читання запиту прискорюється від 6 до 25 відсотків залежно від моделі, а генерація не прискорюється взагалі або навіть просідає. Сенс зв'язки в тому, щоб помістити більшу модель, а не швидше отримати відповідь.
Кому підходить, а кому ні
Підходить, якщо ви розробляєте під CUDA і вам потрібне середовище, ідентичне продакшену, без рахунків за хмару щомісяця. Якщо дані не можна вивозити за периметр компанії. Якщо треба обслуговувати команду, а не одну людину. Якщо ви робите файнтюн моделей до 70 мільярдів параметрів методом QLoRA і готові чекати.
Не підходить, якщо потрібен швидкий інтерактивний чат із найбільшою моделлю, яку вдалось знайти. Якщо ви працюєте у Windows: система тільки Linux на архітектурі aarch64, і частина звичного софту під неї просто не зібрана. Якщо ви розраховуєте на ігри чи класичний рендер.
Що з цього є в нас
- Сервер PNY NVIDIA DGX Spark AI Server: версія Founders Edition із накопичувачем на 4 ТБ
- NVIDIA AI Enterprise для DGX Spark: підписка на рік, є також варіанти на три й п'ять років
- NVIDIA Mission Control: керування кластером, якщо вузлів більше одного
- Сервери Nutanix: коли прототип виріс і потрібна продакшн-платформа
Часті питання
Чому система показує 119 ГБ замість 128?
Це різниця між гігабайтами й гібібайтами, а не витрати операційної системи. Реально доступно 122 570 МБ. NVIDIA підтвердила це окремою статтею бази знань.
Чи можна поставити Windows?
Ні. Пристрій працює під DGX OS на базі Ubuntu 24.04 для архітектури aarch64. Windows не підтримується, і софт під ARM-Linux доступний не весь.
Яку розетку і який ДБЖ закладати?
Зовнішній блок живлення на 240 Вт, звичайної побутової лінії достатньо з великим запасом. Це принципова відмінність від робочої станції з кількома відеокартами, де під навантаженням потрібні окремі 20 ампер.
Що потрібно, щоб з'єднати два пристрої?
Кабель QSFP до QSFP на 112 Гбіт/с, він підключається напряму між портами ConnectX-7. Комутатор потрібен лише коли вузлів більше трьох. Швидший кабель переваги не дасть: 200 Гбіт/с на порт це апаратна стеля.
Наскільки він гучний?
Під повним навантаженням чутно, у простої практично ні. Це настільний пристрій, а не серверний вузол із тонкими вентиляторами на 15 тисяч обертів.
Не впевнені, що Spark це саме ваш інструмент?
Розкажіть, які моделі плануєте запускати і скільки людей з ними працюватиме. Інженер порахує, чи вистачить одного вузла, чи вигідніше зібрати станцію на RTX PRO 6000.
Отримати консультацію