Не каждой команде нужна стойка, трёхфазное питание и серверная комната. Часто задача звучит проще: держать модель рядом, работать с ней каждый день и никуда не отдавать данные. Для этого есть башня под стол с одной картой на 96 ГБ.
Почему 96 ГБ на одной карте это важно
Модель, которая помещается в память одной карты, работает просто: загрузил и считаешь. Как только она перестаёт помещаться, начинается другая инженерия: разделение слоёв между картами, обмен промежуточными результатами, настройка, которая съедает дни. На 96 ГБ спокойно живут модели до 70 миллиардов параметров в четырёхбитном квантовании, а модели до 32B помещаются в более точных форматах.
Ещё одна разница, которую замечают не сразу. В станции под столом карта та же самая RTX PRO 6000 Blackwell, что и в серверах, только в рабочем исполнении со своим охлаждением. Это не урезанная версия: память и вычислительные блоки те же.
Конфигурация
Следующий шаг после DGX Spark
Многие начинают с DGX Spark: коробка на 128 ГБ унифицированной памяти, которая стоит на столе и даёт попробовать большие модели без серверной. Ограничение у неё одно и известное: пропускная способность памяти 273 ГБ/с. Модель на 70B в плотном формате выдаёт единицы токенов в секунду, и для работы это медленно.
Станция на RTX PRO 6000 снимает именно это ограничение: у Blackwell память GDDR7 с пропускной способностью в несколько раз выше. Модель того же размера начинает отвечать со скоростью, пригодной для ежедневной работы, а не для демонстрации.
Spark остаётся полезным: он тихий, компактный и хорошо держит роль устройства для экспериментов. Станция нужна тогда, когда модель из игрушки стала рабочим инструментом.
Что даёт Threadripper PRO вместо обычного процессора
Три вещи, и каждая критична именно для этой задачи. Память с коррекцией ошибок: долгий расчёт не должен падать из-за одной перевёрнутой ячейки. Восемь каналов памяти вместо двух: данные до карты идут быстрее. И много линий PCIe, благодаря которым вторая карта, быстрый диск и сеть не отбирают линии друг у друга.
Тридцать два ядра здесь не для рендеринга, а для подготовки данных. Токенизация, загрузка датасета, предварительная обработка изображений: всё это процессорная работа, и пока она идёт, карта простаивает.
Куда расти
- Вторая карта RTX PRO 6000 Max-Q: вместе 192 ГБ видеопамяти. Версия Max-Q потребляет меньше и лучше уживается в башне вдвоём.
- Память до 512 ГБ, когда датасеты перестают помещаться.
- Блок питания взят с запасом сразу, поэтому апгрейд не потребует замены корпуса и БП.
Кому подходит, а кому нет
Подходит
- Локальный запуск моделей до 70B, когда данные нельзя выносить наружу.
- Дообучение под свою предметную область на небольших датасетах.
- Компьютерное зрение: обучение детекторов, обработка видео, синтетические данные.
- Команды без серверной комнаты: станция работает от обычной розетки и стоит в кабинете.
Лучше посмотреть на другое
- Несколько человек одновременно: одна карта быстро становится очередью, тут выигрывает сервер с разделением через MIG.
- Обучение с нуля на большом корпусе: нужны общая память и несколько ускорителей.
Частые вопросы
Шумит ли такая станция в кабинете?
Под нагрузкой слышно, но это уровень мощного рабочего компьютера, а не стойки. Серверные машины в кабинет ставить нельзя вообще: там сквозной продув и совсем другая громкость.
Хватит обычной розетки?
Да, с одной картой. Если планируете вторую, стоит проверить линию: пиковое потребление подбирается к полутора киловаттам.
Почему память ECC, она же дороже?
Потому что расчёт идёт часами. Ошибка в одном бите портит результат тихо, без падения программы, и вы узнаете о ней в самом конце.
Можно ли поставить две обычные RTX PRO 6000 вместо Max-Q?
Технически да, практически лучше Max-Q: у неё ниже потребление и тепловыделение, а в башне две полномощные карты стоят вплотную и мешают друг другу дышать.
Что из этого есть у нас
- ETE AI Workstation: станция из этой статьи
- ETE AI Server RTX PRO: та же карта, четыре штуки, в стойке
- ETE AI Server H200: когда задача переросла одну машину
- Видеокарты NVIDIA: RTX PRO 6000 и версия Max-Q отдельно