Вопрос «сколько видеопамяти нужно под нашу модель» определяет конфигурацию сервера целиком: от количества карт до блоков питания. Разбираем ETE AI Server H200 по узлам и объясняем, почему именно так, а не иначе.

Задача, под которую собрана машина

Есть два разных мира. Первый: модель уже обучена, её надо крутить на потоке запросов и раздавать ответы. Второй: модель надо обучить или дообучить на своих данных, и тогда решает не количество запросов в секунду, а то, помещается ли всё нужное в память ускорителя вместе с градиентами и состоянием оптимизатора.

ETE AI Server H200 собран под второй мир. Две карты NVIDIA H200 NVL по 141 ГБ, связанные мостом NVLink, дают 282 ГБ общей памяти. Для задачи это один пул, а не две отдельные карты, между которыми приходится вручную резать модель.

Конфигурация

Платформа 4U для стойки, до 8 GPU, PCIe 5.0
Процессоры 2× AMD EPYC 9355, вместе 64 ядра
Память 1 ТБ DDR5-6400 ECC Registered, 16× 64 ГБ
Ускорители 2× NVIDIA H200 NVL 141 ГБ + мост NVLink, вместе 282 ГБ
Диски 2× 960 ГБ NVMe M.2 под систему в RAID1, 4× 7.68 ТБ U.2 NVMe под данные
Сеть 2× 25GbE плюс двухпортовый 200G QSFP112
Питание 4× 3200 Вт с резервированием 2+2

Сколько памяти съедает модель

Простая арифметика, которая объясняет, откуда взялись 282 ГБ. Веса модели в половинной точности весят примерно два байта на параметр. Модель на 70 миллиардов параметров это 140 ГБ одних только весов, и это ещё без кеша внимания, без активаций и без запаса на длинный контекст. Одна карта на 141 ГБ такую модель едва вмещает, пара карт работает свободно.

Модель Веса в FP16 Что это значит для сервера
8B около 16 ГБ помещается где угодно, тут место под длинный контекст и десятки параллельных сессий
70B около 140 ГБ одна карта на пределе, пара карт с NVLink даёт запас на кеш и обучение
70B, дообучение от 280 ГБ градиенты и состояние оптимизатора удваивают потребность, это ровно наш случай
405B в 4 битах около 200 ГБ запускается на паре карт, для комфорта лучше четыре

Зачем мост NVLink, если карты и так в одном сервере

Две карты в соседних слотах общаются через PCIe. Когда модель поделена между ними, каждый шаг вычислений означает обмен промежуточными результатами, и шина становится узким местом: карты ждут друг друга вместо того, чтобы считать.

Мост NVLink соединяет карты напрямую, мимо PCIe. Память пары задача видит как общую, а обмен идёт на порядок быстрее. Без моста 282 ГБ остаются двумя отдельными кучками по 141 ГБ, и большая модель в них просто не раскладывается.

Практический вывод: если в коммерческом предложении стоят две H200 NVL, а моста NVLink нет, это другая машина. Спрашивайте про мост отдельно.

Почему 64 ядра, 1 ТБ памяти и именно такие диски

Процессоры в такой машине не считают модель, они кормят карты данными. Два EPYC 9355 дают 64 ядра и достаточно линий PCIe 5.0, чтобы карты, сеть и диски не дрались за шину. Экономия на процессоре тут оборачивается простоем ускорителей: карта ждёт, пока загрузится следующая порция данных.

Оперативной памяти берут примерно вдвое больше, чем видеопамяти, отсюда 1 ТБ. Датасет разворачивается в системной памяти, оттуда идёт к картам, и при 282 ГБ VRAM полтерабайта уже ощутимо тесны.

Диски разделены намеренно. Пара M.2 в зеркале держит систему: она должна пережить выход одного накопителя без остановки. Четыре U.2 по 7.68 ТБ это рабочее пространство под датасеты и чекпоинты, куда пишут постоянно и большими блоками.

Питание: почему четыре блока, а не два

Схема 2+2 означает, что машина работает на двух блоках, а ещё два стоят в резерве. Выход одного блока или пропажа напряжения на одном вводе не останавливает обучение, которое идёт сутками. Перезапуск долгой задачи стоит дороже пары блоков питания.

Куда расти

  • До четырёх H200 NVL с мостом 4-way: 564 ГБ общей памяти под модели, которые на паре карт уже не помещаются.
  • Оперативная память до 2 ТБ, когда датасет перестаёт вмещаться и начинает упираться в диск.
  • Подписка NVIDIA AI Enterprise: поддерживаемые сборки фреймворков вместо самостоятельно собранного окружения.

Это не наша выдумка

Конфигурация собрана по рыночному стандарту: американские интеграторы Exxact, BIZON и Thinkmate продают такие же машины под те же задачи. Та же платформа 4U на восемь карт, те же EPYC, та же схема питания. Мы сверили состав по их конфигураторам, чтобы не изобретать свой велосипед и чтобы заказчик мог сравнить.

Кому подходит, а кому нет

Подходит

  • Обучение и дообучение моделей на собственных данных.
  • Инференс больших моделей, где решает объём памяти, а не количество параллельных сессий.
  • Задачи, где данные нельзя отдавать в чужое облако.

Лучше посмотреть на другое

  • Продакшн-инференс нескольких средних моделей одновременно: там выгоднее сервер на RTX PRO 6000, у него дешевле гигабайт видеопамяти.
  • Работа одного человека с моделью до 70B: хватит рабочей станции под столом, без стойки и трёхфазного питания.

Частые вопросы

Можно ли начать с двух карт и добавить ещё две потом?

Да, платформа держит до восьми ускорителей. Но мост NVLink на две карты и на четыре это разные изделия, поэтому при расширении понадобится версия 4-way.

Что с охлаждением и шумом?

Это стоечная машина со сквозным продувом, в кабинете она стоять не может. Для рабочего помещения есть станция под столом на той же карте RTX PRO 6000.

Сколько это потребляет под нагрузкой?

Две H200 NVL добавляют около 1200 Вт, плюс процессоры, диски и вентиляторы. Планируйте стойку с запасом, а ввод питания согласовывайте до поставки.

Зачем в сервере порт на 200 Гбит/с?

Он нужен, когда машин станет больше одной. Обучение на нескольких узлах упирается в скорость обмена между ними, и обычные 25GbE тут становятся узким местом.

Можно ли взять конфигурацию без дисков или с другой памятью?

Да, состав согласовывается перед заказом. Базовая конфигурация это отправная точка, а не жёсткий набор.

Что из этого есть у нас

Автор: Инженер ETE