Nutanix продаёт гиперконвергенцию, NVIDIA продаёт ускорители, а собирать из этого кластер под инференс приходится покупателю. Вопросы каждый раз одни и те же: сколько карт влезает в узел, можно ли разрезать карту на четыре виртуалки, что из этого работает именно на AHV. Ниже ответы со ссылками и с местами, где документация молчит.
Коротко
- Из пятнадцати моделей Nutanix в каталоге карты берут одиннадцать. Потолок на узел: четыре H100 или L40S в NX-9151-G9
- Буква N в артикуле про GPU не говорит ничего. NX-8155N-G8 берёт три карты, NX-8150N-G8 не берёт ни одной
- L40S на MIG не делится вообще. RTX PRO 6000 Server Edition делится на четыре инстанса по 24 ГБ
- MIG-backed vGPU в таблице функций NVIDIA стоит напротив vSphere, Red Hat KVM и Ubuntu KVM. AHV там не назван
- Включённый MIG выключает NVLink и P2P, а NCCL с ним не работает. Распределённое обучение на слайсах не соберётся
Какие узлы берут карты, а какие нет
Гиперконвергентный узел это сервер, в котором диски, вычисления и сеть сшиты в один блок под управлением AOS. Место под полноразмерную карту там есть не всегда: его съедают дисковые отсеки и вентиляторы. Поэтому одни модели NX берут до четырёх ускорителей, а другие не берут ни одного.
| Узел | Форм-фактор | Графика |
|---|---|---|
| NX-9151-G9 | 2U1N | до 4× H100 или L40S |
| NX-3155-G9 | 2U1N | до 4× A2, L4, L40S или H100 |
| NX-8155-G9 | 2U1N | до 3× A2, L4 или L40S |
| NX-8155N-G8 | 2U1N | до 3× A2 или L4 |
| NX-8155A-G9 | 2U1N | 2× A100 80 ГБ |
| NX-3155GN-G8 | 2U1N | до 2× A2 |
| NX-3035-G9, NX-1175S-G9 | 2U2N и 1U1N | до 2× A2 или L4 |
| NX-1150S-G9 | 2U1N | 0 или 1× L4 24 ГБ |
| NX-1065-G9, NX-3060-G9 | 2U3N и 2U2N | опционально, модель карты в спецификации не указана |
| NX-8150-G9, NX-8170-G9, NX-8150N-G8, NX-8170N-G8 | 1U1N и 2U1N | не поддерживается |
Источник: спецификации узлов в каталоге Nutanix на ete.ua. Последняя строка это узлы под базы данных и хранилище
Буква в артикуле ничего не гарантирует
Читать GPU-способность по суффиксу не выходит, и таблица выше показывает это напрямую. NX-8155N-G8 берёт до трёх карт A2 или L4. NX-8150N-G8 с той же буквой не берёт ни одной. Поколение тоже не подсказка: среди G8 есть и узлы с картами, и узлы без них.
Надёжных проверок две: строка «Графика (GPU)» в спецификации модели и перечень карт, валидированный именно под это шасси. NX-9151-G9 и NX-3155-G9 принимают H100, а NX-8155-G9 с тем же форм-фактором 2U1N останавливается на L40S. Ограничивают питание и продув, не размер корпуса.
Что мешает поставить пятую карту
Разрыв по питанию внутри линейки шестикратный. NX-1150S-G9 в пике берёт 531 ВА, NX-9151-G9 с четырьмя картами требует 3232 ВА и отдаёт до 11 021 BTU в час. Это отдельный разговор с дата-центром про фазу и кондиционирование ряда.
Вторая причина в том, что серверные карты пассивные. У L40S и RTX PRO 6000 Server Edition нет собственных вентиляторов, они живут за счёт продува шасси спереди назад. На форуме NVIDIA есть показательная тема: L40S в рабочей станции Dell Precision 7875 показывала 100 градусов в простое. Вне сервера это не лечится.
Три способа отдать карту виртуалке
| Способ | Как делится | Изоляция и лицензия |
|---|---|---|
| Passthrough | карта целиком одной виртуалке | полная, лицензия vGPU не нужна |
| Time-sliced vGPU | деление во времени, процессы идут по очереди | изоляции памяти и сбоев нет, лицензия обязательна |
| MIG-backed vGPU | аппаратные слайсы, работают параллельно | аппаратная, плюс 20% к производительности против time-sliced |
Источники: MIG-backed vGPU, сайзинг-гайд RTX vWS
Дальше идёт ограничение, которое ломает половину планов на многокарточные узлы. Документация MIG формулирует это прямо: при включённом MIG линки NVLink выключаются, карта теряет P2P между GPU, а NCCL с MIG не поддерживается. Позиция NVIDIA на форуме: распределённое обучение через MIG теоретически можно протолкнуть по сети через GPUDirect RDMA, но это будет медленнее, чем взять слайс побольше или выключить MIG совсем. Деление карты и быстрый обмен между картами это взаимоисключающие режимы.
Какая карта на сколько делится
| Карта | Максимум MIG-инстансов | Наименьший слайс |
|---|---|---|
| RTX PRO 6000 Blackwell Server Edition, 96 ГБ | 4 | 1g.24gb, 24 ГБ и 46 SM |
| RTX PRO 4500 Blackwell, 32 ГБ | 2 | 1g.16gb, 16 ГБ |
| H100 PCIe, 80 ГБ | 7 | 1g.10gb, 10 ГБ |
| H200 NVL, 141 ГБ | 7 | 1g.18gb, 18 ГБ |
| A100, 80 ГБ | 7 | 1g.10gb, 10 ГБ |
| L40S 48 ГБ, L4, A2, A16 | MIG не поддерживают | остаётся passthrough или time-sliced vGPU |
Источники: перечень GPU с поддержкой MIG, таблица профилей MIG
Последняя строка стоит внимания при выборе узла: L40S это основная карта для NX-9151-G9 и NX-3155-G9, и именно она на слайсы не режется. Вопрос «чем тогда делить L40S» задавали на форуме NVIDIA те, кто выбрал карту по TFLOPS и только потом посмотрел на модель партиционирования.
Что из этого работает на AHV
NVIDIA ведёт отдельную страницу поддержки Nutanix AHV и классифицирует гипервизор как generic Linux with KVM. Обычный time-sliced vGPU на нём работает. А вот в сводной таблице функций строка MIG-backed vGPU отмечена только для vSphere, Red Hat KVM и Ubuntu KVM с версии 19.0, причём time-sliced MIG-backed профили обещают аж в vGPU 20.0. Совместимость под свою версию AOS проверяйте до заказа.
Второе всплывает уже после внедрения. Живая миграция виртуалки с vGPU требует на принимающем хосте той же физической карты, той же версии драйвера и той же версии гипервизора. Между разными MIG-профилями миграция не работает вообще.
Третье это поведение без лицензии. Виртуалка получает 20 минут на полной скорости, потом падает до 1280 на 1024 и трёх кадров в секунду, а CUDA выключается. Compute-профили серии C идут только в составе NVIDIA AI Enterprise и лицензируются на каждый GPU в сервере, графические профили vWS считаются на одновременного пользователя. В бюджет эти две модели учёта идут отдельно.
Сколько виртуалок реально выходит на карту
| Тип vGPU | Память на виртуалку | Виртуалок на карту |
|---|---|---|
| DC-96C | 96 ГБ | 1 |
| DC-48C | 48 ГБ | 2 |
| DC-24C | 24 ГБ | 4 |
| DC-12C | 12 ГБ | 8 |
| DC-8C | 8 ГБ | 12 |
Compute-профили для RTX PRO 6000 Blackwell Server Edition. Источник: таблица vGPU-типов Blackwell
Под рабочие места NVIDIA даёт одинаковую плотность для обеих карт RTX PRO: от двух до четырёх тяжёлых пользователей на карту, от трёх до шести средних и от шести до восьми лёгких. Разница между RTX PRO 4500 и RTX PRO 6000 не в количестве мест, а в том, какие профили вытягивает карта. Там же оговорка, которая спасает бюджет: планировщик best effort часто даёт переподписку в два или три раза. Правило мониторинга простое. Заполнение видеопамяти в виртуалке не должно часто превышать 90%, а в среднем должно оставаться ниже 70%.
| Что мерили | Без деления | С MIG |
|---|---|---|
| Red Hat, flan-t5-base на A100 40 ГБ | ≈3400 ток/с | ≈9800 ток/с на семи слайсах |
| NVIDIA, голосовой конвейер на A100 | 0,74 запроса/с на GPU | 1,00 (time-slicing дал 0,76) |
| Задержка P95 защищённого сервиса рядом с «шумными соседями» | ≈2499 мс | ≈1319 мс |
| Одна задача на слайсе 1/7 A100, время итерации | 0,00533 с | 0,02640 с |
Источники: Red Hat, блог NVIDIA, тест изоляции на vLLM, форум NVIDIA
Последняя строка и есть цена деления: отдельный слайс примерно впятеро медленнее целой карты. Суммарная пропускная способность при этом растёт, потому что маленькая модель не загружает A100 полностью. Бенчмарк MIGPerf добавляет поправку: N инстансов не дают стабильных N-кратных показателей, масштабирование сублинейное.
С чего начинать и как расти
Рабочая стартовая конфигурация это три узла: на трёх работает репликация RF2 и кластер переживает потерю одного узла без остановки виртуалок. Карты нужны не в каждом. Схема, которая чаще всего взлетает: три узла под общую нагрузку, из них один или два с ускорителями под инференс.
GPU-пул лучше держать однородным, и причина именно в живой миграции. Второй узел с такой же картой даёт запас производительности и место, куда переедет виртуалка во время обновления первого. Смешанный кластер с L40S в одном узле и RTX PRO 6000 в другом тоже работает, но каждое плановое обслуживание превращается в вечер с остановками сервисов.
Что из этого есть у нас
- Серверы Nutanix: вся линейка NX из таблицы выше
- RTX PRO 6000 Blackwell Server Edition 96 ГБ: MIG на четыре части, наименьший слайс 1g.24gb это 24 ГБ и 46 SM
- NVIDIA L40S 48 ГБ: валидирована для NX-9151-G9, NX-3155-G9 и NX-8155-G9
- NVIDIA L4 24 ГБ: карта для младших узлов линейки
Частые вопросы
L40S не поддерживает MIG. Чем тогда её делить?
Time-sliced vGPU. Профиль L40S-8Q даёт шесть инстансов в гомогенной конфигурации и четыре в гетерогенной. Аппаратной изоляции памяти и сбоев там нет: карта переключается между виртуалками во времени.
Можно ли посадить 24 рабочих места на одну L40S?
Вопрос о профиле L40S-2B и 24 местах висит на форуме NVIDIA без ответа, а максимума vGPU на плату для L40S сайзинг-гайд не даёт. Считать приходится от памяти на место.
Нужна ли AI Enterprise, чтобы отдать MIG-инстанс в виртуалку?
Для compute-профилей серии C да: они идут только в составе AI Enterprise и лицензируются на каждый GPU в сервере. Сам MIG на голом Linux лицензии не требует, это функция драйвера. Деньги начинаются там, где слайс нужно отдать гипервизору.
Карта держит 450 Вт вместо 600. Это брак?
Чаще всего это кабель. Sense-конфигурация 12VHPWR задаёт лимит питания, и с кабелем Supermicro CBL-PWEX-0962Y-30 nvidia-smi честно показывает 450 Вт. Под 600 Вт нужен CBL-PWEX-1364Y-30, об этом есть отдельная ветка на форуме NVIDIA.
Что дают две карты в узле вместо одной?
Не единый пул памяти. Две карты по 48 ГБ это две независимые по 48, а не 96 на одну модель. Польза в том, чтобы держать несколько моделей рядом (реранкер, эмбеддинги, основная LLM) или обслуживать вдвое больше людей.
Эти модели есть в каталоге
Планируете GPU в кластере Nutanix?
Напишите, какие модели запускаете и сколько людей с ними будет работать. Инженер подберёт узел и количество карт, посчитает лицензии и скажет, где конфигурация упрётся в питание стойки.
Получить консультацию


