NVIDIA L40S это кристалл AD102 в пассивном серверном исполнении: 48 ГБ GDDR6 с ECC, 568 тензорных ядер, 142 RT-ядра. Производитель продаёт её как карту генеративного AI, хотя владельцы гоняют на ней ещё рендер и виртуальные рабочие места. Собрали паспорт, чужие замеры и задачи, за которые ей лучше не браться.

Коротко

  • 48 ГБ GDDR6 с ECC и 864 ГБ/с. Кристалл тот же, что в L40 и RTX 6000 Ada
  • От L40 отличается двумя пунктами: 350 Вт вместо 300 и вдвое более высокие тензорные числа (FP8 733 против 362 TFLOPS)
  • Официальные сравнения NVIDIA: до 5 раз быстрее в инференсе, чем A40, и до 1,2× против A100
  • Потолок vGPU 32 машины, и то на профиле 1 ГБ. Дизайнеру с 8 ГБ выходит 6 мест
  • FP64, NVLink и MIG отсутствуют. Карта пассивная: в рабочей станции греется до 100°C

Что внутри

Кристалл один на три карты. L40, L40S и RTX 6000 Ada собраны на AD102 с идентичной начинкой: 18 176 CUDA-ядер, 568 тензорных, 142 RT-ядра, 48 ГБ GDDR6 с ECC. Расходятся они в трёх вещах: охлаждение, заявленная тензорная пропускная способность и скорость памяти. У Ada последняя 960 ГБ/с, у обеих L40 по 864 при одинаковой шине.

Характеристика L40S
Ядра AD102: 18 176 CUDA, 568 тензорных, 142 RT
Память 48 ГБ GDDR6 с ECC, 384 бит, 864 ГБ/с
FP32 и RT Core 91,6 и 212 TFLOPS
FP8 Tensor 733 TFLOPS, 1 466 с разрежённостью
Видео 3× NVENC и 3× NVDEC с AV1, 4× DisplayPort 1.4a
Питание и размер 350 Вт, 2 слота, 4,4″ × 10,5″, разъём 16-pin
Охлаждение пассивное, вентиляторов на плате нет
Виртуализация vGPU есть, профили от 1 до 48 ГБ. MIG и NVLink нет

Источники: страница L40S на nvidia.com, product brief L40

Одно число держите отдельно. 864 ГБ/с задают потолок генерации токенов: чтобы выдать один токен, надо прочитать все веса модели.

Чем L40S отличается от L40

Вопрос возникает у каждого, кто открыл оба даташита.

Параметр L40 L40S Разница
TDP 300 Вт 350 Вт +50 Вт
FP32 90,5 91,6 +1,2%
RT Core 209 212 +1,4%
TF32 Tensor 90,5 183 ×2,02
BF16 и FP16 Tensor 181,05 362,05 ×2,0
FP8 Tensor 362 733 ×2,02

TFLOPS без разрежённости. Память и количество ядер одинаковые. Источники: даташит L40, страница L40S

FP32 отличается на 1,2%, тензорные числа ровно вдвое. Кристалл тот же, ядер поровну, память одинаковая. Вопрос задали на форуме разработчиков, и NVIDIA ответила так: «The spec details in the respective PDF files are correct. They are not written in a way to be directly comparable because those GPUs serve completely different needs». Технического объяснения не дали.

Разница в акцентах тоже есть. L40 подают как карту визуализации и Omniverse, L40S как карту генеративного AI. Частоты NVIDIA не приводит ни в одном даташите: в сторонних базах L40 значится как 735 МГц база и 2 490 boost, L40S как 1 065 и 2 520.

Инференс: чего ждать на самом деле

Главное сравнение со страницы продукта: «up to 5X higher inference performance than the previous-generation NVIDIA A40». Про A100 NVIDIA пишет тоже, но скромнее: «up to 1.2x more generative AI inference performance and up to 1.7x training performance compared with the NVIDIA A100». Ходовая по блогам реселлеров цифра 1,5× в инференсе у самой NVIDIA не встречается.

Интереснее замеры пользователей. В ветке на форуме прогнали InstantNGP, 3D Gaussian Splatting и обучение ResNet в FP32 и получили L40S на уровне 80% скорости RTX 6000 Ada, хотя ждали прироста в 1,5 раза. Robert_Crovella из штата NVIDIA объяснил в той же ветке: ожидать надо примерно 1:1, а небольшое преимущество Ada вылезает там, где всё упирается в пропускную способность памяти, 960 ГБ/с против 864. Про A100 там сказано, что L40S выходит в диапазон от 0,8 до 1,2 только на отдельных нагрузках в FP8.

ServeTheHome формулирует позицию карты без прикрас: она берёт доступностью. H100 тогда стоил примерно в 2,6 раза дороже.

И про объём. Плотная модель на 70 миллиардов параметров в FP8 занимает около 70 ГБ, в 48 не влезает. Двумя картами не лечится: NVLink у L40 задокументирован как «Not supported».

Рендер, видео и Omniverse

Тут карта чувствует себя естественнее. 212 TFLOPS на RT-ядрах, три энкодера и три декодера с AV1 в обе стороны. Даташит L40 перечисляет задачи откровенно: Omniverse Enterprise, пакетный рендер, облачный гейминг, виртуальные станции.

Прямых замеров рендера именно на L40S в открытом доступе мало. Ближайший ориентир: The Register прогнал FLUX.1 Dev (12 миллиардов параметров, BF16, 50 шагов) за 37 секунд на RTX 6000 Ada. С учётом тех самых 80%, от L40S логично ждать около 45 секунд. Это пересчёт, а не замер.

В рендере 48 ГБ решают больше, чем частоты. Сцена, которая не влезает в 24 ГБ, на такой карте не посчитается вообще.

Сколько виртуальных рабочих мест она тянет

Всё упирается в профиль на пользователя. Ниже Q-профили, то есть редакция RTX Virtual Workstation под 3D и CAD.

Профиль Память на место Машин на карту Смешанный режим
L40S-48Q 48 ГБ 1 1
L40S-24Q 24 ГБ 2 2
L40S-16Q 16 ГБ 3 2
L40S-12Q 12 ГБ 4 4
L40S-8Q 8 ГБ 6 4
L40S-6Q 6 ГБ 8 8
L40S-4Q 4 ГБ 12 8
L40S-2Q 2 ГБ 24 16
L40S-1Q 1 ГБ 32 16

Источник: Virtual GPU Software User Guide DU-06920-001, с. 222 и 223

Читать таблицу надо с конца. Тридцать две машины это профиль на 1 ГБ кадрового буфера, то есть почта и браузер. Дизайнеру с CAD нужно от 8 ГБ, а это уже шесть мест. Аппаратный потолок L40 совпадает: 32 виртуальные функции SR-IOV.

Две ловушки. Запись «1 × 48 NVIDIA vWS» читают как 48 пользователей на карту, хотя это одна карта на 48 ГБ. А в режиме разноразмерных профилей плотность падает ниже арифметики из-за ограничений упаковки: шесть инстансов по 8 ГБ становятся четырьмя.

Лицензии считаются отдельно, по модели Concurrent User. Ещё пробел: максимального количества vGPU на плату для L40S в сайзинг-гайде NVIDIA нет, а число «24 VDI на карту» пошло из вопроса пользователя.

Самую интересную схему ServeTheHome описывает одной фразой: «vGPU workloads during the day and then transitioned to AI workloads in the evening».

Где она проигрывает специализированным картам

FP64 фактически нет. Двойная точность не приведена ни в одном даташите L40S, L40 и RTX 6000 Ada. Оценка с форума ServeTheHome звучит резко: «L40S and ADA 6000 can not do FP64 calculations.. So things like math modeling is out of the question». Гидродинамика и конечные элементы: не сюда.

Пропускная способность памяти. 864 ГБ/с против 3,35 ТБ/с у H100 SXM и 4,8 ТБ/с у H200 NVL. На генерации токенов это разница в разы. ServeTheHome: это «not the cards if you need absolute memory capacity, bandwidth, or FP64 performance».

Нет MIG. Страница L40S на nvidia.com говорит прямо: «Multi-Instance GPU (MIG) Support: No». В product brief L40 то же самое, аппаратного деления вся архитектура Ada не имеет. На форуме есть люди, которые взяли карту за TFLOPS и только потом искали способ её разделить.

Следующее поколение поднимает потолок. RTX PRO 6000 Blackwell Server Edition даёт 96 ГБ GDDR7, 1 597 ГБ/с, MIG на четыре изолированных инстанса и до 48 одновременных пользователей, если MIG совместить с vGPU.

Пассивная карта: ошибка, которая дорого стоит

На плате L40S нет ни одного вентилятора. Ей нужен принудительный поток воздуха от передней панели к задней, который создаёт серверное шасси. В станцию её ставить нельзя, и на форуме NVIDIA лежит показательный случай: карта в Dell Precision 7875, 100°C в простое, восклицательный знак в диспетчере устройств и ошибка «insufficient system resources exist to complete the API». Ответ сообщества: карта пассивная и полагается на серверные вентиляторы, «it is not really suited to workstations».

Совет по диагностике оттуда же: посмотрите потребление программно. Низкая мощность при простойных частотах означает, что воздуха не хватает по давлению, а не по объёму. Требований к CFM и статическому давлению для пассивных карт NVIDIA не публикует, планировать приходится по шасси.

На форуме ServeTheHome разницу формулируют так: RTX 6000 Ada с кулером сделана под работу 8 часов пять дней в неделю, а плату L40S перепроектировали под более высокие температуры и «design for 24/7».

Что из этого есть у нас

Частые вопросы

Нормально ли, что L40S в простое греется до 100°C?

Нет, причина почти всегда одна. Карте нужен серверный продув, в станции такого потока нет. Проверьте потребление программно: низкая мощность при простойных частотах означает нехватку давления.

Почему даташиты дают двукратную разницу в FP8 при одинаковых ядрах?

Официального объяснения нет. NVIDIA ответила, что оба документа корректны, но написаны не так, чтобы их можно было прямо сравнивать. Ориентируйтесь на тест своей задачи, а не на строку в PDF.

Профиль 2B даёт 24 машины на карту. Почему L40S не советуют под vPC?

Вопрос в такой формулировке висит на форуме NVIDIA без ответа. Технически профили B доступны. Но офисные места закроет карта дешевле, а RT-ядра и FP8 в L40S останутся без работы.

L40S не поддерживает MIG. Как тогда делить карту между задачами?

Только через vGPU, то есть программное деление с лицензией на каждого одновременного пользователя. Если в проекте записана аппаратная изоляция, берите Blackwell Server Edition.

Что брать под LLM: L40S или RTX 6000 Ada?

Самый точный ответ из практики: «We use both but L40S for production and 6000 Ada for developers». L40S сделана под круглосуточную работу в сервере, Ada под рабочий день в станции и имеет на 11% выше пропускную способность.

Не уверены, что L40S закроет именно ваш сценарий?

Напишите, какие модели планируете запускать, сколько людей будет работать в виртуальных станциях и в какое шасси пойдёт карта. Инженер посчитает профили, лицензии и количество карт и проверит, хватит ли продува сервера.

Получить консультацию