NVIDIA L40S це кристал AD102 у пасивному серверному виконанні: 48 ГБ GDDR6 з ECC, 568 тензорних ядер, 142 RT-ядра. Виробник продає її як карту генеративного AI, хоча власники ганяють на ній ще рендер і віртуальні робочі місця. Зібрали паспорт, чужі заміри і задачі, до яких їй не варто братися.

Коротко

  • 48 ГБ GDDR6 з ECC і 864 ГБ/с. Кристал той самий, що в L40 і RTX 6000 Ada
  • Від L40 відрізняється двома пунктами: 350 Вт замість 300 і вдвічі вищі тензорні числа (FP8 733 проти 362 TFLOPS)
  • Офіційні порівняння NVIDIA: до 5 разів швидший інференс за A40 і до 1,2× проти A100
  • Стеля vGPU 32 машини, і то на профілі 1 ГБ. Дизайнеру з 8 ГБ виходить 6 місць
  • FP64, NVLink і MIG відсутні. Карта пасивна: у робочій станції гріється до 100°C

Що всередині

Кристал один на три карти. L40, L40S і RTX 6000 Ada зібрані на AD102 з ідентичною начинкою: 18 176 CUDA-ядер, 568 тензорних, 142 RT-ядра, 48 ГБ GDDR6 з ECC. Розходяться вони у трьох речах: охолодження, заявлена тензорна пропускна здатність і швидкість пам'яті. В Ada остання 960 ГБ/с, в обох L40 по 864 при однаковій шині.

Характеристика L40S
Ядра AD102: 18 176 CUDA, 568 тензорних, 142 RT
Пам'ять 48 ГБ GDDR6 з ECC, 384 біт, 864 ГБ/с
FP32 і RT Core 91,6 і 212 TFLOPS
FP8 Tensor 733 TFLOPS, 1 466 з розрідженістю
Відео 3× NVENC і 3× NVDEC з AV1, 4× DisplayPort 1.4a
Живлення й розмір 350 Вт, 2 слоти, 4,4″ × 10,5″, роз'єм 16-pin
Охолодження пасивне, вентиляторів на платі немає
Віртуалізація vGPU є, профілі від 1 до 48 ГБ. MIG і NVLink немає

Джерела: сторінка L40S на nvidia.com, product brief L40

Одне число тримайте окремо. 864 ГБ/с задають стелю генерації токенів: щоб видати один токен, треба прочитати всі ваги моделі.

Чим L40S відрізняється від L40

Питання виникає в кожного, хто відкрив обидва даташити.

Параметр L40 L40S Різниця
TDP 300 Вт 350 Вт +50 Вт
FP32 90,5 91,6 +1,2%
RT Core 209 212 +1,4%
TF32 Tensor 90,5 183 ×2,02
BF16 і FP16 Tensor 181,05 362,05 ×2,0
FP8 Tensor 362 733 ×2,02

TFLOPS без розрідженості. Пам'ять і кількість ядер однакові. Джерела: даташит L40, сторінка L40S

FP32 відрізняється на 1,2%, тензорні числа рівно вдвічі. Кристал той самий, ядер порівну, пам'ять однакова. Питання поставили на форумі розробників, і NVIDIA відповіла так: «The spec details in the respective PDF files are correct. They are not written in a way to be directly comparable because those GPUs serve completely different needs». Технічного пояснення не дали.

Різниця в акцентах теж є. L40 подають як карту візуалізації та Omniverse, L40S як карту генеративного AI. Частот NVIDIA не наводить у жодному даташиті: у сторонніх базах L40 значиться як 735 МГц база і 2 490 boost, L40S як 1 065 і 2 520.

Інференс: чого чекати насправді

Головне порівняння зі сторінки продукту: «up to 5X higher inference performance than the previous-generation NVIDIA A40». Про A100 NVIDIA пише теж, але скромніше: «up to 1.2x more generative AI inference performance and up to 1.7x training performance compared with the NVIDIA A100». Поширена в блогах реселерів цифра 1,5× в інференсі у самої NVIDIA не зустрічається.

Цікавіші заміри користувачів. У гілці на форумі прогнали InstantNGP, 3D Gaussian Splatting і навчання ResNet у FP32 і отримали L40S на рівні 80% швидкості RTX 6000 Ada, хоча чекали приросту в 1,5 раза. Robert_Crovella зі штату NVIDIA пояснив у тій же гілці: очікувати треба близько 1:1, а невелика перевага Ada вилазить там, де все впирається в пропускну здатність пам'яті, 960 ГБ/с проти 864. Про A100 там сказано, що L40S виходить у діапазон від 0,8 до 1,2 лише на окремих навантаженнях у FP8.

ServeTheHome формулює позицію карти без прикрас: вона бере доступністю. H100 тоді коштував приблизно у 2,6 раза дорожче.

І про обсяг. Щільна модель на 70 мільярдів параметрів у FP8 займає близько 70 ГБ, у 48 не влазить. Двома картами не лікується: NVLink у L40 задокументовано як «Not supported».

Рендер, відео і Omniverse

Тут карта почувається природніше. 212 TFLOPS на RT-ядрах, три енкодери й три декодери з AV1 у обидва боки. Даташит L40 перелічує задачі відверто: Omniverse Enterprise, пакетний рендер, хмарний гейминг, віртуальні станції.

Прямих замірів рендеру саме на L40S у відкритому доступі мало. Найближчий орієнтир: The Register прогнав FLUX.1 Dev (12 мільярдів параметрів, BF16, 50 кроків) за 37 секунд на RTX 6000 Ada. Зважаючи на ті 80%, від L40S логічно чекати близько 45 секунд. Це перерахунок, не замір.

У рендері 48 ГБ вирішують більше за частоти. Сцена, що не влазить у 24 ГБ, на такій карті не порахується взагалі.

Скільки віртуальних робочих місць вона тягне

Усе залежить від профілю на користувача. Нижче Q-профілі, тобто редакція RTX Virtual Workstation під 3D і CAD.

Профіль Пам'ять на місце Машин на карту Змішаний режим
L40S-48Q 48 ГБ 1 1
L40S-24Q 24 ГБ 2 2
L40S-16Q 16 ГБ 3 2
L40S-12Q 12 ГБ 4 4
L40S-8Q 8 ГБ 6 4
L40S-6Q 6 ГБ 8 8
L40S-4Q 4 ГБ 12 8
L40S-2Q 2 ГБ 24 16
L40S-1Q 1 ГБ 32 16

Джерело: Virtual GPU Software User Guide DU-06920-001, с. 222 і 223

Читати таблицю треба з кінця. Тридцять дві машини це профіль на 1 ГБ кадрового буфера, тобто пошта й браузер. Дизайнеру з CAD треба від 8 ГБ, а це вже шість місць. Апаратна стеля L40 збігається: 32 віртуальні функції SR-IOV.

Дві пастки. Запис «1 × 48 NVIDIA vWS» читають як 48 користувачів на карту, хоча це одна карта на 48 ГБ. А в режимі різнорозмірних профілів щільність падає нижче арифметики через обмеження пакування: шість інстансів по 8 ГБ стають чотирма.

Ліцензії рахуються окремо, за моделлю Concurrent User. Ще прогалина: максимальної кількості vGPU на плату для L40S у сайзинг-гайді NVIDIA немає, а число «24 VDI на карту» пішло з питання користувача.

Найцікавішу схему ServeTheHome описує однією фразою: «vGPU workloads during the day and then transitioned to AI workloads in the evening».

Де вона програє спеціалізованим картам

FP64 фактично немає. Подвійна точність не наведена в жодному даташиті L40S, L40 і RTX 6000 Ada. Оцінка з форуму ServeTheHome звучить різко: «L40S and ADA 6000 can not do FP64 calculations.. So things like math modeling is out of the question». Гідродинаміка й скінченні елементи: не сюди.

Пропускна здатність пам'яті. 864 ГБ/с проти 3,35 ТБ/с у H100 SXM і 4,8 ТБ/с у H200 NVL. На генерації токенів це різниця в разах. ServeTheHome: це «not the cards if you need absolute memory capacity, bandwidth, or FP64 performance».

Немає MIG. Сторінка L40S на nvidia.com каже прямо: «Multi-Instance GPU (MIG) Support: No». У product brief L40 те саме, апаратного поділу вся архітектура Ada не має. На форумі є люди, які взяли карту за TFLOPS і лише потім шукали спосіб її розділити.

Наступне покоління піднімає стелю. RTX PRO 6000 Blackwell Server Edition дає 96 ГБ GDDR7, 1 597 ГБ/с, MIG на чотири ізольовані інстанси і до 48 одночасних користувачів, якщо MIG поєднати з vGPU.

Пасивна карта: помилка, яка коштує дорого

На платі L40S немає жодного вентилятора. Їй потрібен примусовий потік повітря від передньої панелі до задньої, який створює серверне шасі. У станцію її ставити не можна, і на форумі NVIDIA лежить показовий випадок: карта в Dell Precision 7875, 100°C у простої, знак оклику в диспетчері пристроїв і помилка «insufficient system resources exist to complete the API». Відповідь спільноти: карта пасивна й покладається на серверні вентилятори, «it is not really suited to workstations».

Порада з діагностики звідти ж: подивіться споживання програмно. Низька потужність при простійних частотах означає, що повітря бракує за тиском, а не за обсягом. Вимог до CFM і статичного тиску для пасивних карт NVIDIA не публікує, планувати доводиться за шасі.

На форумі ServeTheHome різницю формулюють так: RTX 6000 Ada з кулером зроблена під роботу 8 годин п'ять днів на тиждень, а плату L40S перепроєктували під вищі температури і «design for 24/7».

Що з цього є в нас

Часті питання

Чи нормально, що L40S у простої гріється до 100°C?

Ні, причина майже завжди одна. Карті потрібен серверний продув, у станції такого потоку немає. Перевірте споживання програмно: низька потужність при простійних частотах означає брак тиску.

Чому даташити дають дворазову різницю у FP8 при однакових ядрах?

Офіційного пояснення немає. NVIDIA відповіла, що обидва документи коректні, але написані не так, щоб їх можна було прямо порівнювати. Орієнтуйтесь на тест своєї задачі, а не на рядок у PDF.

Профіль 2B дає 24 машини на карту. Чому L40S не радять під vPC?

Питання в такому формулюванні висить на форумі NVIDIA без відповіді. Технічно профілі B доступні. Але офісні місця закриє дешевша карта, а RT-ядра й FP8 у L40S лишаться без роботи.

L40S не підтримує MIG. Як тоді ділити карту між задачами?

Тільки через vGPU, тобто програмний поділ з ліцензією на кожного одночасного користувача. Якщо в проєкті записана апаратна ізоляція, беріть Blackwell Server Edition.

Що брати під LLM: L40S чи RTX 6000 Ada?

Найточніша відповідь із практики: «We use both but L40S for production and 6000 Ada for developers». L40S зроблена під цілодобову роботу в сервері, Ada під робочий день у станції і має на 11% вищу пропускну здатність.

Не впевнені, що L40S закриє саме ваш сценарій?

Напишіть, які моделі плануєте запускати, скільки людей працюватиме у віртуальних станціях і в яке шасі піде карта. Інженер порахує профілі, ліцензії та кількість карт і перевірить, чи вистачить продуву сервера.

Отримати консультацію