NVIDIA L40S це кристал AD102 у пасивному серверному виконанні: 48 ГБ GDDR6 з ECC, 568 тензорних ядер, 142 RT-ядра. Виробник продає її як карту генеративного AI, хоча власники ганяють на ній ще рендер і віртуальні робочі місця. Зібрали паспорт, чужі заміри і задачі, до яких їй не варто братися.
Коротко
- 48 ГБ GDDR6 з ECC і 864 ГБ/с. Кристал той самий, що в L40 і RTX 6000 Ada
- Від L40 відрізняється двома пунктами: 350 Вт замість 300 і вдвічі вищі тензорні числа (FP8 733 проти 362 TFLOPS)
- Офіційні порівняння NVIDIA: до 5 разів швидший інференс за A40 і до 1,2× проти A100
- Стеля vGPU 32 машини, і то на профілі 1 ГБ. Дизайнеру з 8 ГБ виходить 6 місць
- FP64, NVLink і MIG відсутні. Карта пасивна: у робочій станції гріється до 100°C
Що всередині
Кристал один на три карти. L40, L40S і RTX 6000 Ada зібрані на AD102 з ідентичною начинкою: 18 176 CUDA-ядер, 568 тензорних, 142 RT-ядра, 48 ГБ GDDR6 з ECC. Розходяться вони у трьох речах: охолодження, заявлена тензорна пропускна здатність і швидкість пам'яті. В Ada остання 960 ГБ/с, в обох L40 по 864 при однаковій шині.
| Характеристика | L40S |
|---|---|
| Ядра | AD102: 18 176 CUDA, 568 тензорних, 142 RT |
| Пам'ять | 48 ГБ GDDR6 з ECC, 384 біт, 864 ГБ/с |
| FP32 і RT Core | 91,6 і 212 TFLOPS |
| FP8 Tensor | 733 TFLOPS, 1 466 з розрідженістю |
| Відео | 3× NVENC і 3× NVDEC з AV1, 4× DisplayPort 1.4a |
| Живлення й розмір | 350 Вт, 2 слоти, 4,4″ × 10,5″, роз'єм 16-pin |
| Охолодження | пасивне, вентиляторів на платі немає |
| Віртуалізація | vGPU є, профілі від 1 до 48 ГБ. MIG і NVLink немає |
Джерела: сторінка L40S на nvidia.com, product brief L40
Одне число тримайте окремо. 864 ГБ/с задають стелю генерації токенів: щоб видати один токен, треба прочитати всі ваги моделі.
Чим L40S відрізняється від L40
Питання виникає в кожного, хто відкрив обидва даташити.
| Параметр | L40 | L40S | Різниця |
|---|---|---|---|
| TDP | 300 Вт | 350 Вт | +50 Вт |
| FP32 | 90,5 | 91,6 | +1,2% |
| RT Core | 209 | 212 | +1,4% |
| TF32 Tensor | 90,5 | 183 | ×2,02 |
| BF16 і FP16 Tensor | 181,05 | 362,05 | ×2,0 |
| FP8 Tensor | 362 | 733 | ×2,02 |
TFLOPS без розрідженості. Пам'ять і кількість ядер однакові. Джерела: даташит L40, сторінка L40S
FP32 відрізняється на 1,2%, тензорні числа рівно вдвічі. Кристал той самий, ядер порівну, пам'ять однакова. Питання поставили на форумі розробників, і NVIDIA відповіла так: «The spec details in the respective PDF files are correct. They are not written in a way to be directly comparable because those GPUs serve completely different needs». Технічного пояснення не дали.
Різниця в акцентах теж є. L40 подають як карту візуалізації та Omniverse, L40S як карту генеративного AI. Частот NVIDIA не наводить у жодному даташиті: у сторонніх базах L40 значиться як 735 МГц база і 2 490 boost, L40S як 1 065 і 2 520.
Інференс: чого чекати насправді
Головне порівняння зі сторінки продукту: «up to 5X higher inference performance than the previous-generation NVIDIA A40». Про A100 NVIDIA пише теж, але скромніше: «up to 1.2x more generative AI inference performance and up to 1.7x training performance compared with the NVIDIA A100». Поширена в блогах реселерів цифра 1,5× в інференсі у самої NVIDIA не зустрічається.
Цікавіші заміри користувачів. У гілці на форумі прогнали InstantNGP, 3D Gaussian Splatting і навчання ResNet у FP32 і отримали L40S на рівні 80% швидкості RTX 6000 Ada, хоча чекали приросту в 1,5 раза. Robert_Crovella зі штату NVIDIA пояснив у тій же гілці: очікувати треба близько 1:1, а невелика перевага Ada вилазить там, де все впирається в пропускну здатність пам'яті, 960 ГБ/с проти 864. Про A100 там сказано, що L40S виходить у діапазон від 0,8 до 1,2 лише на окремих навантаженнях у FP8.
ServeTheHome формулює позицію карти без прикрас: вона бере доступністю. H100 тоді коштував приблизно у 2,6 раза дорожче.
І про обсяг. Щільна модель на 70 мільярдів параметрів у FP8 займає близько 70 ГБ, у 48 не влазить. Двома картами не лікується: NVLink у L40 задокументовано як «Not supported».
Рендер, відео і Omniverse
Тут карта почувається природніше. 212 TFLOPS на RT-ядрах, три енкодери й три декодери з AV1 у обидва боки. Даташит L40 перелічує задачі відверто: Omniverse Enterprise, пакетний рендер, хмарний гейминг, віртуальні станції.
Прямих замірів рендеру саме на L40S у відкритому доступі мало. Найближчий орієнтир: The Register прогнав FLUX.1 Dev (12 мільярдів параметрів, BF16, 50 кроків) за 37 секунд на RTX 6000 Ada. Зважаючи на ті 80%, від L40S логічно чекати близько 45 секунд. Це перерахунок, не замір.
У рендері 48 ГБ вирішують більше за частоти. Сцена, що не влазить у 24 ГБ, на такій карті не порахується взагалі.
Скільки віртуальних робочих місць вона тягне
Усе залежить від профілю на користувача. Нижче Q-профілі, тобто редакція RTX Virtual Workstation під 3D і CAD.
| Профіль | Пам'ять на місце | Машин на карту | Змішаний режим |
|---|---|---|---|
| L40S-48Q | 48 ГБ | 1 | 1 |
| L40S-24Q | 24 ГБ | 2 | 2 |
| L40S-16Q | 16 ГБ | 3 | 2 |
| L40S-12Q | 12 ГБ | 4 | 4 |
| L40S-8Q | 8 ГБ | 6 | 4 |
| L40S-6Q | 6 ГБ | 8 | 8 |
| L40S-4Q | 4 ГБ | 12 | 8 |
| L40S-2Q | 2 ГБ | 24 | 16 |
| L40S-1Q | 1 ГБ | 32 | 16 |
Джерело: Virtual GPU Software User Guide DU-06920-001, с. 222 і 223
Читати таблицю треба з кінця. Тридцять дві машини це профіль на 1 ГБ кадрового буфера, тобто пошта й браузер. Дизайнеру з CAD треба від 8 ГБ, а це вже шість місць. Апаратна стеля L40 збігається: 32 віртуальні функції SR-IOV.
Дві пастки. Запис «1 × 48 NVIDIA vWS» читають як 48 користувачів на карту, хоча це одна карта на 48 ГБ. А в режимі різнорозмірних профілів щільність падає нижче арифметики через обмеження пакування: шість інстансів по 8 ГБ стають чотирма.
Ліцензії рахуються окремо, за моделлю Concurrent User. Ще прогалина: максимальної кількості vGPU на плату для L40S у сайзинг-гайді NVIDIA немає, а число «24 VDI на карту» пішло з питання користувача.
Найцікавішу схему ServeTheHome описує однією фразою: «vGPU workloads during the day and then transitioned to AI workloads in the evening».
Де вона програє спеціалізованим картам
FP64 фактично немає. Подвійна точність не наведена в жодному даташиті L40S, L40 і RTX 6000 Ada. Оцінка з форуму ServeTheHome звучить різко: «L40S and ADA 6000 can not do FP64 calculations.. So things like math modeling is out of the question». Гідродинаміка й скінченні елементи: не сюди.
Пропускна здатність пам'яті. 864 ГБ/с проти 3,35 ТБ/с у H100 SXM і 4,8 ТБ/с у H200 NVL. На генерації токенів це різниця в разах. ServeTheHome: це «not the cards if you need absolute memory capacity, bandwidth, or FP64 performance».
Немає MIG. Сторінка L40S на nvidia.com каже прямо: «Multi-Instance GPU (MIG) Support: No». У product brief L40 те саме, апаратного поділу вся архітектура Ada не має. На форумі є люди, які взяли карту за TFLOPS і лише потім шукали спосіб її розділити.
Наступне покоління піднімає стелю. RTX PRO 6000 Blackwell Server Edition дає 96 ГБ GDDR7, 1 597 ГБ/с, MIG на чотири ізольовані інстанси і до 48 одночасних користувачів, якщо MIG поєднати з vGPU.
Пасивна карта: помилка, яка коштує дорого
На платі L40S немає жодного вентилятора. Їй потрібен примусовий потік повітря від передньої панелі до задньої, який створює серверне шасі. У станцію її ставити не можна, і на форумі NVIDIA лежить показовий випадок: карта в Dell Precision 7875, 100°C у простої, знак оклику в диспетчері пристроїв і помилка «insufficient system resources exist to complete the API». Відповідь спільноти: карта пасивна й покладається на серверні вентилятори, «it is not really suited to workstations».
Порада з діагностики звідти ж: подивіться споживання програмно. Низька потужність при простійних частотах означає, що повітря бракує за тиском, а не за обсягом. Вимог до CFM і статичного тиску для пасивних карт NVIDIA не публікує, планувати доводиться за шасі.
На форумі ServeTheHome різницю формулюють так: RTX 6000 Ada з кулером зроблена під роботу 8 годин п'ять днів на тиждень, а плату L40S перепроєктували під вищі температури і «design for 24/7».
Що з цього є в нас
- PNY NVIDIA L40S 48 ГБ (TCSL40SPCIE-PB): роздрібна упаковка
- PNY NVIDIA L40S 48 ГБ (TCSL40SPCIE-BLK): та сама карта в bulk-упаковці
- PNY NVIDIA L40 48 ГБ (TCSL40PCIE-PB): версія під візуалізацію й Omniverse
- PNY NVIDIA L40 48 ГБ (TCSL40PCIE-BLK): bulk-версія L40
- PNY NVIDIA RTX 6000 Ada: той самий кристал з кулером
- PNY NVIDIA RTX PRO 6000 Server Edition 96 ГБ: покоління Blackwell з MIG
Часті питання
Чи нормально, що L40S у простої гріється до 100°C?
Ні, причина майже завжди одна. Карті потрібен серверний продув, у станції такого потоку немає. Перевірте споживання програмно: низька потужність при простійних частотах означає брак тиску.
Чому даташити дають дворазову різницю у FP8 при однакових ядрах?
Офіційного пояснення немає. NVIDIA відповіла, що обидва документи коректні, але написані не так, щоб їх можна було прямо порівнювати. Орієнтуйтесь на тест своєї задачі, а не на рядок у PDF.
Профіль 2B дає 24 машини на карту. Чому L40S не радять під vPC?
Питання в такому формулюванні висить на форумі NVIDIA без відповіді. Технічно профілі B доступні. Але офісні місця закриє дешевша карта, а RT-ядра й FP8 у L40S лишаться без роботи.
L40S не підтримує MIG. Як тоді ділити карту між задачами?
Тільки через vGPU, тобто програмний поділ з ліцензією на кожного одночасного користувача. Якщо в проєкті записана апаратна ізоляція, беріть Blackwell Server Edition.
Що брати під LLM: L40S чи RTX 6000 Ada?
Найточніша відповідь із практики: «We use both but L40S for production and 6000 Ada for developers». L40S зроблена під цілодобову роботу в сервері, Ada під робочий день у станції і має на 11% вищу пропускну здатність.
Ці моделі є в каталозі
Не впевнені, що L40S закриє саме ваш сценарій?
Напишіть, які моделі плануєте запускати, скільки людей працюватиме у віртуальних станціях і в яке шасі піде карта. Інженер порахує профілі, ліцензії та кількість карт і перевірить, чи вистачить продуву сервера.
Отримати консультацію


