Питання «скільки відеопам'яті треба під нашу модель» вирішує конфігурацію сервера цілком: від кількості карт до блоків живлення. Розбираємо ETE AI Server H200 по вузлах і пояснюємо, чому саме так, а не інакше.
Задача, під яку зібрана машина
Є два різні світи. Перший: модель уже навчена, її треба крутити на потоці запитів і роздавати відповіді. Другий: модель треба навчити або дотренувати на своїх даних, і тоді вирішує не кількість запитів за секунду, а те, чи вміщається все потрібне в пам'ять прискорювача разом із градієнтами й станом оптимізатора.
ETE AI Server H200 зібраний під другий світ. Дві карти NVIDIA H200 NVL по 141 ГБ, зв'язані мостом NVLink, дають 282 ГБ спільної пам'яті. Для задачі це один пул, а не дві окремі карти, між якими доводиться вручну різати модель.
Конфігурація
Скільки пам'яті з'їдає модель
Проста арифметика, яка пояснює, звідки взялись 282 ГБ. Ваги моделі в половинній точності важать приблизно два байти на параметр. Модель на 70 мільярдів параметрів це 140 ГБ тільки ваг, і це ще без кеша уваги, без активацій і без запасу на довгий контекст. Одна карта на 141 ГБ таку модель ледве вміщає, пара карт працює вільно.
Навіщо міст NVLink, якщо карти й так в одному сервері
Дві карти в сусідніх слотах спілкуються через PCIe. Коли модель поділена між ними, кожен крок обчислень означає обмін проміжними результатами, і шина стає вузьким місцем: карти чекають одна одну замість того, щоб рахувати.
Міст NVLink з'єднує карти напряму, повз PCIe. Пам'ять пари задача бачить як спільну, а обмін іде на порядок швидше. Без мосту 282 ГБ лишаються двома окремими купками по 141 ГБ, і велика модель у них просто не розкладається.
Практичний висновок: якщо в комерційній пропозиції стоять дві H200 NVL, а мосту NVLink немає, це інша машина. Питайте про міст окремо.
Чому 64 ядра, 1 ТБ пам'яті й саме такі диски
Процесори в такій машині не рахують модель, вони годують карти даними. Два EPYC 9355 дають 64 ядра й достатньо ліній PCIe 5.0, щоб карти, мережа й диски не билися за шину. Економія на процесорі тут обертається простоєм прискорювачів: карта чекає, поки завантажиться наступна порція даних.
Оперативної пам'яті беруть приблизно вдвічі більше за відеопам'ять, звідси 1 ТБ. Датасет розгортається в системній пам'яті, звідти йде до карт, і при 282 ГБ VRAM півтерабайта вже відчутно тісні.
Диски розділені навмисно. Пара M.2 у дзеркалі тримає систему: вона має пережити вихід одного накопичувача без зупинки. Чотири U.2 по 7.68 ТБ це робочий простір під датасети й чекпойнти, куди пишуть постійно й великими блоками.
Живлення: чому чотири блоки, а не два
Схема 2+2 означає, що машина працює на двох блоках, а ще два стоять у резерві. Вихід одного блока або зникнення напруги на одному вводі не зупиняє навчання, яке триває добами. Перезапуск довгої задачі коштує дорожче за пару блоків живлення.
Куди зростати
- До чотирьох H200 NVL із мостом 4-way: 564 ГБ спільної пам'яті під моделі, які на парі карт уже не поміщаються.
- Оперативна пам'ять до 2 ТБ, коли датасет перестає вміщатися й починає впиратись у диск.
- Підписка NVIDIA AI Enterprise: підтримувані збірки фреймворків замість самостійного складання оточення.
Це не наша вигадка
Конфігурація зібрана за ринковим стандартом: американські інтегратори Exxact, BIZON і Thinkmate продають такі самі машини під ті самі задачі. Та сама платформа 4U на вісім карт, ті самі EPYC, та сама схема живлення. Ми звірили склад по їхніх конфігураторах, щоб не вигадувати власний велосипед і щоб замовник міг порівняти.
Кому підходить, а кому ні
Підходить
- Навчання й дотренування моделей на власних даних.
- Інференс великих моделей, де вирішує обсяг пам'яті, а не кількість паралельних сесій.
- Задачі, де дані не можна віддавати в чужу хмару.
Краще подивитись на інше
- Продакшн-інференс кількох середніх моделей одночасно: там вигідніший сервер на RTX PRO 6000, у нього дешевший гігабайт відеопам'яті.
- Робота однієї людини з моделлю до 70B: вистачить робочої станції під столом, без стійки й трифазного живлення.
Часті питання
Чи можна почати з двох карт і додати ще дві потім?
Так, платформа тримає до восьми прискорювачів. Але міст NVLink на дві карти й на чотири це різні вироби, тому при розширенні знадобиться версія 4-way.
Що з охолодженням і шумом?
Це стійкова машина з наскрізним продувом, у кабінеті вона стояти не може. Для робочого приміщення є станція під столом на тій самій карті RTX PRO 6000.
Скільки це споживає під навантаженням?
Дві H200 NVL додають близько 1200 Вт, плюс процесори, диски й вентилятори. Плануйте стійку з запасом, а введення живлення узгоджуйте до постачання.
Навіщо в сервері порт на 200 Гбіт/с?
Він потрібен, коли машин стане більше однієї. Навчання на кількох вузлах впирається у швидкість обміну між ними, і звичайні 25GbE тут стають вузьким місцем.
Чи можна взяти конфігурацію без дисків або з іншою пам'яттю?
Так, склад узгоджується перед замовленням. Базова конфігурація це відправна точка, а не жорсткий набір.
Що з цього є в нас
- ETE AI Server H200: машина з цієї статті, склад узгоджуємо під задачу
- ETE AI Server RTX PRO: чотири карти по 96 ГБ під продакшн-інференс
- ETE AI Workstation: та сама карта в башті під стіл
- Мости NVLink: плати 2-WAY і 4-WAY для H200 NVL
- Мережеве обладнання NVIDIA: адаптери, комутатори й кабелі, якщо вузлів буде кілька