Nutanix продає гіперконвергенцію, NVIDIA продає прискорювачі, а зібрати з цього кластер під інференс доводиться покупцеві. Питання щоразу однакові: скільки карт влазить у вузол, чи можна розрізати карту на чотири віртуалки, що з цього працює саме на AHV. Нижче відповіді з посиланнями і з місцями, де документація мовчить.
Коротко
- З п'ятнадцяти моделей Nutanix у каталозі карти беруть одинадцять. Стеля на вузол: чотири H100 або L40S у NX-9151-G9
- Літера N в артикулі про GPU не каже нічого. NX-8155N-G8 бере три карти, NX-8150N-G8 не бере жодної
- L40S на MIG не ділиться взагалі. RTX PRO 6000 Server Edition ділиться на чотири інстанси по 24 ГБ
- MIG-backed vGPU у таблиці функцій NVIDIA стоїть навпроти vSphere, Red Hat KVM і Ubuntu KVM. AHV там не названий
- Увімкнений MIG вимикає NVLink і P2P, а NCCL із ним не працює. Розподілене навчання на слайсах не збереться
Які вузли беруть карти, а які ні
Гіперконвергентний вузол це сервер, у якому диски, обчислення і мережа зшиті в один блок під керуванням AOS. Місце під повнорозмірну карту там є не завжди: його з'їдають дискові відсіки й вентилятори. Тому одні моделі NX беруть до чотирьох прискорювачів, а інші не беруть жодного.
| Вузол | Форм-фактор | Графіка |
|---|---|---|
| NX-9151-G9 | 2U1N | до 4× H100 або L40S |
| NX-3155-G9 | 2U1N | до 4× A2, L4, L40S або H100 |
| NX-8155-G9 | 2U1N | до 3× A2, L4 або L40S |
| NX-8155N-G8 | 2U1N | до 3× A2 або L4 |
| NX-8155A-G9 | 2U1N | 2× A100 80 ГБ |
| NX-3155GN-G8 | 2U1N | до 2× A2 |
| NX-3035-G9, NX-1175S-G9 | 2U2N і 1U1N | до 2× A2 або L4 |
| NX-1150S-G9 | 2U1N | 0 або 1× L4 24 ГБ |
| NX-1065-G9, NX-3060-G9 | 2U3N і 2U2N | опційно, модель карти в специфікації не вказана |
| NX-8150-G9, NX-8170-G9, NX-8150N-G8, NX-8170N-G8 | 1U1N і 2U1N | не підтримується |
Джерело: специфікації вузлів у каталозі Nutanix на ete.ua. Останній рядок це вузли під бази даних і сховище
Літера в артикулі нічого не гарантує
Читати GPU-здатність по суфіксу не виходить, і таблиця вище це показує напряму. NX-8155N-G8 бере до трьох карт A2 або L4. NX-8150N-G8 з тією ж літерою не бере жодної. Покоління теж не підказка: серед G8 є і вузли з картами, і вузли без них.
Надійних перевірок дві: рядок «Графіка (GPU)» у специфікації моделі і перелік карт, валідований саме для цього шасі. NX-9151-G9 і NX-3155-G9 приймають H100, а NX-8155-G9 з тим самим форм-фактором 2U1N зупиняється на L40S. Обмежують живлення і продув, не розмір корпусу.
Що заважає поставити п'яту карту
Розрив за живленням у лінійці шестикратний. NX-1150S-G9 у піку бере 531 ВА, NX-9151-G9 з чотирма картами вимагає 3232 ВА і віддає до 11 021 BTU на годину. Це окрема розмова з дата-центром про фазу і кондиціонування ряду.
Друга причина в тому, що серверні карти пасивні. У L40S і RTX PRO 6000 Server Edition немає власних вентиляторів, вони живуть за рахунок продуву шасі спереду назад. На форумі NVIDIA є показова тема: L40S у робочій станції Dell Precision 7875 показувала 100 градусів у простої. Поза сервером це не лікується.
Три способи віддати карту віртуалці
| Спосіб | Як ділиться | Ізоляція і ліцензія |
|---|---|---|
| Passthrough | карта цілком одній віртуалці | повна, ліцензія vGPU не потрібна |
| Time-sliced vGPU | поділ у часі, процеси йдуть по черзі | ізоляції пам'яті й збоїв немає, ліцензія обов'язкова |
| MIG-backed vGPU | апаратні слайси, працюють паралельно | апаратна, плюс 20% до продуктивності проти time-sliced |
Джерела: MIG-backed vGPU, сайзинг-гайд RTX vWS
Далі йде обмеження, яке ламає половину планів на мультикартові вузли. Документація MIG формулює це прямо: при увімкненому MIG посилання NVLink вимикаються, карта втрачає P2P між GPU, а NCCL із MIG не підтримується. Позиція NVIDIA на форумі: розподілене навчання через MIG теоретично можна пропхати по мережі через GPUDirect RDMA, але це буде повільніше, ніж узяти більший слайс або вимкнути MIG зовсім. Поділ карти і швидкий обмін між картами це взаємовиключні режими.
Яка карта на скільки ділиться
| Карта | Максимум MIG-інстансів | Найменший слайс |
|---|---|---|
| RTX PRO 6000 Blackwell Server Edition, 96 ГБ | 4 | 1g.24gb, 24 ГБ і 46 SM |
| RTX PRO 4500 Blackwell, 32 ГБ | 2 | 1g.16gb, 16 ГБ |
| H100 PCIe, 80 ГБ | 7 | 1g.10gb, 10 ГБ |
| H200 NVL, 141 ГБ | 7 | 1g.18gb, 18 ГБ |
| A100, 80 ГБ | 7 | 1g.10gb, 10 ГБ |
| L40S 48 ГБ, L4, A2, A16 | MIG не підтримують | лишається passthrough або time-sliced vGPU |
Останній рядок вартий уваги при виборі вузла: L40S це основна карта для NX-9151-G9 і NX-3155-G9, і саме вона на слайси не ріжеться. Питання «чим тоді ділити L40S» ставили на форумі NVIDIA ті, хто обрав карту за TFLOPS і лише потім подивився на модель партиціонування.
Що з цього працює на AHV
NVIDIA веде окрему сторінку підтримки Nutanix AHV і класифікує гіпервізор як generic Linux with KVM. Звичайний time-sliced vGPU на ньому працює. А от у зведеній таблиці функцій рядок MIG-backed vGPU позначений лише для vSphere, Red Hat KVM і Ubuntu KVM з версії 19.0, причому time-sliced MIG-backed профілі обіцяють аж у vGPU 20.0. Сумісність під свою версію AOS перевіряйте до замовлення.
Друге спливає вже після впровадження. Жива міграція віртуалки з vGPU вимагає на приймаючому хості тієї самої фізичної карти, тієї самої версії драйвера і тієї самої версії гіпервізора. Між різними MIG-профілями міграція не працює взагалі.
Третє це поведінка без ліцензії. Віртуалка отримує 20 хвилин на повній швидкості, потім падає до 1280 на 1024 і трьох кадрів за секунду, а CUDA вимикається. Compute-профілі серії C ідуть тільки в складі NVIDIA AI Enterprise і ліцензуються на кожен GPU у сервері, графічні профілі vWS рахуються на одночасного користувача. У бюджет ці дві моделі обліку йдуть окремо.
Скільки віртуалок реально виходить на карту
| Тип vGPU | Пам'ять на віртуалку | Віртуалок на карту |
|---|---|---|
| DC-96C | 96 ГБ | 1 |
| DC-48C | 48 ГБ | 2 |
| DC-24C | 24 ГБ | 4 |
| DC-12C | 12 ГБ | 8 |
| DC-8C | 8 ГБ | 12 |
Compute-профілі для RTX PRO 6000 Blackwell Server Edition. Джерело: таблиця vGPU-типів Blackwell
Під робочі місця NVIDIA дає однакову щільність для обох карт RTX PRO: від двох до чотирьох важких користувачів на карту, від трьох до шести середніх і від шести до восьми легких. Різниця між RTX PRO 4500 і RTX PRO 6000 не в кількості місць, а в тому, які профілі витягує карта. Там же застереження, яке рятує бюджет: планувальник best effort часто дає перепідписку у два або три рази. Правило моніторингу просте. Заповнення відеопам'яті у віртуалці не повинне часто перевищувати 90%, а в середньому має лишатись нижче 70%.
| Що міряли | Без поділу | З MIG |
|---|---|---|
| Red Hat, flan-t5-base на A100 40 ГБ | ≈3400 ток/с | ≈9800 ток/с на семи слайсах |
| NVIDIA, голосовий конвеєр на A100 | 0,74 запиту/с на GPU | 1,00 (time-slicing дав 0,76) |
| Затримка P95 захищеного сервісу поруч із «шумними сусідами» | ≈2499 мс | ≈1319 мс |
| Одна задача на слайсі 1/7 A100, час ітерації | 0,00533 с | 0,02640 с |
Джерела: Red Hat, блог NVIDIA, тест ізоляції на vLLM, форум NVIDIA
Останній рядок і є ціна поділу: окремий слайс приблизно вп'ятеро повільніший за цілу карту. Сумарна пропускна здатність при цьому росте, бо маленька модель не завантажує A100 повністю. Бенчмарк MIGPerf додає поправку: N інстансів не дають стабільних N-кратних показників, масштабування сублінійне.
З чого починати і як рости
Робоча стартова конфігурація це три вузли: на трьох працює реплікація RF2 і кластер переживає втрату одного вузла без зупинки віртуалок. Карти потрібні не в кожному. Схема, яка найчастіше злітає: три вузли під загальне навантаження, з них один або два з прискорювачами під інференс.
GPU-пул краще тримати однорідним, і причина саме в живій міграції. Другий вузол з такою самою картою дає запас продуктивності і місце, куди переїде віртуалка під час оновлення першого. Змішаний кластер з L40S в одному вузлі та RTX PRO 6000 в іншому теж працює, але кожне планове обслуговування перетворюється на вечір із зупинками сервісів.
Що з цього є в нас
- Сервери Nutanix: уся лінійка NX з таблиці вище
- RTX PRO 6000 Blackwell Server Edition 96 ГБ: MIG на чотири частини, найменший слайс 1g.24gb це 24 ГБ і 46 SM
- NVIDIA L40S 48 ГБ: валідована для NX-9151-G9, NX-3155-G9 і NX-8155-G9
- NVIDIA L4 24 ГБ: карта для молодших вузлів лінійки
Часті питання
L40S не підтримує MIG. Чим тоді її ділити?
Time-sliced vGPU. Профіль L40S-8Q дає шість інстансів у гомогенній конфігурації і чотири в гетерогенній. Апаратної ізоляції пам'яті й збоїв там немає: карта перемикається між віртуалками в часі.
Чи можна посадити 24 робочі місця на одну L40S?
Питання про профіль L40S-2B і 24 місця висить на форумі NVIDIA без відповіді, а максимуму vGPU на плату для L40S сайзинг-гайд не дає. Рахувати доводиться від пам'яті на місце.
Чи потрібна AI Enterprise, щоб віддати MIG-інстанс у віртуалку?
Для compute-профілів серії C так: вони йдуть тільки в складі AI Enterprise і ліцензуються на кожен GPU у сервері. Сам MIG на голому Linux ліцензії не вимагає, це функція драйвера. Гроші починаються там, де слайс треба віддати гіпервізору.
Карта тримає 450 Вт замість 600. Це брак?
Найчастіше це кабель. Sense-конфігурація 12VHPWR задає ліміт живлення, і з кабелем Supermicro CBL-PWEX-0962Y-30 nvidia-smi чесно показує 450 Вт. Під 600 Вт потрібен CBL-PWEX-1364Y-30, про це є окрема гілка на форумі NVIDIA.
Що дають дві карти у вузлі замість однієї?
Не єдиний пул пам'яті. Дві карти по 48 ГБ це дві незалежні по 48, а не 96 на одну модель. Користь у тому, щоб тримати кілька моделей поруч (реранкер, ембединги, основна LLM) або обслуговувати вдвічі більше людей.
Ці моделі є в каталозі
Плануєте GPU у кластері Nutanix?
Напишіть, які моделі запускаєте і скільки людей з ними працюватиме. Інженер підбере вузол і кількість карт, порахує ліцензії й скаже, де конфігурація впреться в живлення стійки.
Отримати консультацію


