Питання «скільки відеопам'яті треба під нашу модель» вирішує конфігурацію сервера цілком: від кількості карт до блоків живлення. Розбираємо ETE AI Server H200 по вузлах і пояснюємо, чому саме так, а не інакше.

Задача, під яку зібрана машина

Є два різні світи. Перший: модель уже навчена, її треба крутити на потоці запитів і роздавати відповіді. Другий: модель треба навчити або дотренувати на своїх даних, і тоді вирішує не кількість запитів за секунду, а те, чи вміщається все потрібне в пам'ять прискорювача разом із градієнтами й станом оптимізатора.

ETE AI Server H200 зібраний під другий світ. Дві карти NVIDIA H200 NVL по 141 ГБ, зв'язані мостом NVLink, дають 282 ГБ спільної пам'яті. Для задачі це один пул, а не дві окремі карти, між якими доводиться вручну різати модель.

Конфігурація

Платформа 4U для стійки, до 8 GPU, PCIe 5.0
Процесори 2× AMD EPYC 9355, разом 64 ядра
Пам'ять 1 ТБ DDR5-6400 ECC Registered, 16× 64 ГБ
Прискорювачі 2× NVIDIA H200 NVL 141 ГБ + міст NVLink, разом 282 ГБ
Диски 2× 960 ГБ NVMe M.2 під систему в RAID1, 4× 7.68 ТБ U.2 NVMe під дані
Мережа 2× 25GbE плюс двопортовий 200G QSFP112
Живлення 4× 3200 Вт із резервуванням 2+2

Скільки пам'яті з'їдає модель

Проста арифметика, яка пояснює, звідки взялись 282 ГБ. Ваги моделі в половинній точності важать приблизно два байти на параметр. Модель на 70 мільярдів параметрів це 140 ГБ тільки ваг, і це ще без кеша уваги, без активацій і без запасу на довгий контекст. Одна карта на 141 ГБ таку модель ледве вміщає, пара карт працює вільно.

Модель Ваги у FP16 Що це означає для сервера
8B близько 16 ГБ вміщається де завгодно, тут місце під довгий контекст і десятки паралельних сесій
70B близько 140 ГБ одна карта на межі, пара карт із NVLink дає запас на кеш і навчання
70B, дотренування від 280 ГБ градієнти й стан оптимізатора подвоюють потребу, це рівно наш випадок
405B у 4-бітах близько 200 ГБ запускається на парі карт, для комфорту краще чотири

Навіщо міст NVLink, якщо карти й так в одному сервері

Дві карти в сусідніх слотах спілкуються через PCIe. Коли модель поділена між ними, кожен крок обчислень означає обмін проміжними результатами, і шина стає вузьким місцем: карти чекають одна одну замість того, щоб рахувати.

Міст NVLink з'єднує карти напряму, повз PCIe. Пам'ять пари задача бачить як спільну, а обмін іде на порядок швидше. Без мосту 282 ГБ лишаються двома окремими купками по 141 ГБ, і велика модель у них просто не розкладається.

Практичний висновок: якщо в комерційній пропозиції стоять дві H200 NVL, а мосту NVLink немає, це інша машина. Питайте про міст окремо.

Чому 64 ядра, 1 ТБ пам'яті й саме такі диски

Процесори в такій машині не рахують модель, вони годують карти даними. Два EPYC 9355 дають 64 ядра й достатньо ліній PCIe 5.0, щоб карти, мережа й диски не билися за шину. Економія на процесорі тут обертається простоєм прискорювачів: карта чекає, поки завантажиться наступна порція даних.

Оперативної пам'яті беруть приблизно вдвічі більше за відеопам'ять, звідси 1 ТБ. Датасет розгортається в системній пам'яті, звідти йде до карт, і при 282 ГБ VRAM півтерабайта вже відчутно тісні.

Диски розділені навмисно. Пара M.2 у дзеркалі тримає систему: вона має пережити вихід одного накопичувача без зупинки. Чотири U.2 по 7.68 ТБ це робочий простір під датасети й чекпойнти, куди пишуть постійно й великими блоками.

Живлення: чому чотири блоки, а не два

Схема 2+2 означає, що машина працює на двох блоках, а ще два стоять у резерві. Вихід одного блока або зникнення напруги на одному вводі не зупиняє навчання, яке триває добами. Перезапуск довгої задачі коштує дорожче за пару блоків живлення.

Куди зростати

  • До чотирьох H200 NVL із мостом 4-way: 564 ГБ спільної пам'яті під моделі, які на парі карт уже не поміщаються.
  • Оперативна пам'ять до 2 ТБ, коли датасет перестає вміщатися й починає впиратись у диск.
  • Підписка NVIDIA AI Enterprise: підтримувані збірки фреймворків замість самостійного складання оточення.

Це не наша вигадка

Конфігурація зібрана за ринковим стандартом: американські інтегратори Exxact, BIZON і Thinkmate продають такі самі машини під ті самі задачі. Та сама платформа 4U на вісім карт, ті самі EPYC, та сама схема живлення. Ми звірили склад по їхніх конфігураторах, щоб не вигадувати власний велосипед і щоб замовник міг порівняти.

Кому підходить, а кому ні

Підходить

  • Навчання й дотренування моделей на власних даних.
  • Інференс великих моделей, де вирішує обсяг пам'яті, а не кількість паралельних сесій.
  • Задачі, де дані не можна віддавати в чужу хмару.

Краще подивитись на інше

  • Продакшн-інференс кількох середніх моделей одночасно: там вигідніший сервер на RTX PRO 6000, у нього дешевший гігабайт відеопам'яті.
  • Робота однієї людини з моделлю до 70B: вистачить робочої станції під столом, без стійки й трифазного живлення.

Часті питання

Чи можна почати з двох карт і додати ще дві потім?

Так, платформа тримає до восьми прискорювачів. Але міст NVLink на дві карти й на чотири це різні вироби, тому при розширенні знадобиться версія 4-way.

Що з охолодженням і шумом?

Це стійкова машина з наскрізним продувом, у кабінеті вона стояти не може. Для робочого приміщення є станція під столом на тій самій карті RTX PRO 6000.

Скільки це споживає під навантаженням?

Дві H200 NVL додають близько 1200 Вт, плюс процесори, диски й вентилятори. Плануйте стійку з запасом, а введення живлення узгоджуйте до постачання.

Навіщо в сервері порт на 200 Гбіт/с?

Він потрібен, коли машин стане більше однієї. Навчання на кількох вузлах впирається у швидкість обміну між ними, і звичайні 25GbE тут стають вузьким місцем.

Чи можна взяти конфігурацію без дисків або з іншою пам'яттю?

Так, склад узгоджується перед замовленням. Базова конфігурація це відправна точка, а не жорсткий набір.

Що з цього є в нас

Автор: Інженер ETE