RTX A6000 против L40S: что брать под инференс на 48 ГБ
Обе карты дают 48 ГБ, но L40S дороже в 1.6 раза. Разбор по спецификациям NVIDIA: у L40S есть FP8 и Transformer Engine, у A6000 — NVLink, которого у L40S нет вовсе.
TL;DR — Кратко:
- Объём памяти у карт одинаковый — 48 ГБ GDDR6 с ECC. Разница в цене каталога ровно в 1.6 раза, и она не про память.
- L40S построена на Ada Lovelace и умеет FP8: 733 TFLOPS против 362 в FP16. У A6000 архитектура Ampere, FP8 в ней нет.
- NVLink есть только у A6000 — до 112 ГБ/с на пару карт. В спецификации L40S в строке NVLink стоит No.
Две карты с одинаковым объёмом памяти, разница в цене — в полтора раза с лишним. Вопрос «за что доплата» возникает у всех, кто выбирает сервер на 48 ГБ, и ответ на него не в характеристиках памяти.
По объёму карты неразличимы: 48 ГБ GDDR6 с коррекцией ошибок у обеих. Набор моделей, который в них помещается, совпадает полностью. Расходятся они в двух местах — в поддержке восьмибитных вычислений и в возможности работать в связке.
Ниже сравнение по спецификациям с сайта NVIDIA, расчёт разницы в деньгах и разбор того, в каком сценарии каждая карта оказывается правильным выбором.
Что различается по спецификациям
| Характеристика | RTX A6000 | L40S |
|---|---|---|
| Архитектура | Ampere | Ada Lovelace |
| Память | 48 ГБ GDDR6 с ECC | 48 ГБ GDDR6 с ECC |
| Пропускная способность | NVIDIA не публикует | 864 ГБ/с |
| FP16 Tensor Core | NVIDIA не публикует | 362.05 TFLOPS |
| FP8 Tensor Core | нет в архитектуре | 733 TFLOPS |
| Transformer Engine | нет | есть |
| NVLink | 2-way, до 112 ГБ/с | «NVLink Support: No» |
| Шина | PCI Express Gen 4 x16 | PCI Express Gen 4 x16 |
| Потребление | 300 Вт | 350 Вт |
| Цена каталога | от 82.79 ₽/час | от 132.46 ₽/час |
Источники: страница RTX A6000 и страница L40S на сайте NVIDIA. Значения TFLOPS у L40S приведены без разрежённости, чтобы сравнение было корректным: с ней в спецификации стоит 733 для FP16 и 1 466 для FP8. Цены каталога сняты 19 августа 2026 года, указано минимальное предложение за один GPU.
Две строки таблицы решают выбор, остальные — фон.
FP8: главное, за что доплата
Ada Lovelace умеет считать в восьмибитной точности и несёт Transformer Engine, Ampere — нет. Это не настройка и не вопрос версии драйвера, а разница на уровне архитектуры.
В цифрах разрыв виден по спецификации L40S: 362.05 TFLOPS в FP16 против 733 TFLOPS в FP8, то есть ровно вдвое. Для нагрузок, которые упираются в вычисления, это прямое удвоение потолка.
Где это важно:
Генерация изображений. Диффузионная модель делает от 4 до 50 шагов сэмплирования на изображение, и каждый шаг — вычислительная нагрузка. Здесь FP8 работает напрямую в скорость. Раскладка по моделям и требованиям к памяти — в справочнике по VRAM для Stable Diffusion, SDXL и Flux.
Инференс LLM в квантованных форматах. Веса в FP8 занимают вдвое меньше места, чем в bf16, и читаются вдвое быстрее. На A6000 такую сборку тоже можно запустить, но вычисления пойдут через приведение к более широкому формату, и выигрыш будет только по памяти, не по скорости.
Где не важно:
Обучение и дообучение в bf16. Если пайплайн не переводится на восьмибитные вычисления, Transformer Engine простаивает, и доплата за него не отбивается.
NVLink: единственное, где впереди A6000
Обратная сторона. У A6000 есть мост на две карты с пропускной способностью до 112 ГБ/с — это указано в её спецификации. В спецификации L40S в строке NVLink стоит прямое No.
Разница проявляется ровно в одном сценарии — когда карт больше одной и они обмениваются данными на каждом шаге. При обучении градиенты синхронизируются постоянно, и обмен по PCIe вместо NVLink становится узким местом. Подробнее этот механизм разобран в сравнении A100 и RTX 4090.
Для инференса на одной карте NVLink не даёт ничего. Для тензорного параллелизма при инференсе на двух картах — даёт, но эффект заметно меньше, чем при обучении: обмен идёт реже.
Чего NVIDIA не публикует
Отдельно стоит сказать про пустые ячейки в таблице, потому что при сравнении спецификаций это сбивает.
На странице RTX A6000 нет ни пропускной способности памяти, ни показателей Tensor Core. Список характеристик там ограничен объёмом памяти, разъёмами, форм-фактором, шиной, NVLink и потреблением. Страницы линейки для дата-центров, включая L40S, публикуют и полосу, и TFLOPS по каждому формату.
Практический вывод: сравнивать эти две карты по цифрам производительности напрямую по официальным источникам не получается. Сопоставимы только те параметры, которые вендор приводит для обеих, — объём памяти, шина, NVLink и потребление. Цифры для A6000, которые ходят по обзорам, к первоисточнику не привязаны, и опираться на них при выборе не стоит.
Что из этого следует для решения: выбирайте по архитектурной разнице, которая задокументирована, а не по сравнению чисел, половины которых нет.
Сколько стоит разница
Цены каталога на 19 августа 2026 года, минимальное предложение за один GPU:
| Режим | RTX A6000 | L40S | Разница |
|---|---|---|---|
| Час | 82.79 ₽ | 132.46 ₽ | +49.67 ₽ |
| Сутки | 1 987 ₽ | 3 179 ₽ | +1 192 ₽ |
| Месяц, 24/7 | 59 609 ₽ | 95 371 ₽ | +35 762 ₽ |
| Месяц, 8 часов в день | 19 870 ₽ | 31 790 ₽ | +11 921 ₽ |
Отношение — 1.60. Вопрос, отбивается ли доплата, сводится к одному: удваивает ли FP8 вашу фактическую пропускную способность по задачам.
Если да, L40S выходит дешевле на единицу работы: платите в 1.6 раза больше за час, получаете вдвое больше сделанного. Если пайплайн не использует восьмибитные вычисления, вы платите 35 762 ₽ в месяц за неиспользуемый блок.
Проверяется это одним прогоном, а не расчётом. Общая методика подбора карты под узкое место задачи разобрана в материале про выбор GPU.
Третья карта на 48 ГБ
Сравнение двумя картами не закрывает вопрос, потому что в каталоге их три. RTX 6000 Ada — это тоже 48 ГБ GDDR6 с ECC и тоже Ada Lovelace, то есть с FP8 и Transformer Engine.
| Карта | Архитектура | FP8 | NVLink | Цена |
|---|---|---|---|---|
| RTX A6000 | Ampere | нет | есть | от 82.79 ₽/час |
| RTX 6000 Ada | Ada Lovelace | есть | нет | от 118.92 ₽/час |
| L40S | Ada Lovelace | есть | нет | от 132.46 ₽/час |
Если доплата делается именно ради FP8, RTX 6000 Ada закрывает эту потребность и стоит на 13.54 ₽/час дешевле L40S — около 9 750 ₽ в месяц при круглосуточной работе. На её странице у NVIDIA заявлено 1 457 AI TOPS в FP8 с разрежённостью, потребление 300 Вт, шина PCI Express Gen 4 x16; NVLink в списке характеристик не значится.
Оговорка та же, что и с A6000: это карта профессиональной линейки, и полосу памяти NVIDIA для неё тоже не публикует. Плюс предложений по ней в каталоге обычно меньше, чем по L40S, — проверяйте наличие на момент запуска.
Что не влияет на выбор при аренде
Три параметра, которые попадают в сравнения и при почасовой аренде ничего не решают.
Потребление. 300 Вт против 350 Вт — разница реальная, но электричество входит в стоимость часа. При покупке своей машины она бы считалась, и такой расчёт есть в разборе TCO; при аренде вы платите за час, а не за киловатты.
ECC. Коррекция ошибок есть у обеих карт, это указано в спецификации каждой. Как аргумент в пользу одной из них не работает.
Форм-фактор. Обе двухслотовые, обе с шиной PCI Express Gen 4 x16. В арендованном сервере это вообще не ваша забота.
Что брать
Инференс квантованных моделей, генерация изображений, поток запросов. Берите Ada — L40S или RTX 6000 Ada. FP8 здесь отбивает разницу в цене. Сколько запросов выдержит карта на 48 ГБ и как считается запас под KV-кеш — в справочнике по VRAM для инференса LLM.
Дообучение на двух картах. Берите A6000. Это единственная из трёх с NVLink, и в многокарточном обучении обмен по PCIe станет ограничением.
Задаче нужен только объём, скорость вторична. Берите A6000. По памяти карты идентичны, а стоит она в 1.6 раза меньше.
Не уверены. Берите A6000 на пробный прогон. Если упираетесь в вычисления, а не в память, это будет видно по загрузке карты, и тогда переход на Ada оправдан цифрами.
Что в итоге
Разница в цене между A6000 и L40S — не про память. Объём у них одинаковый, и список моделей, которые в них помещаются, совпадает.
Доплата покрывает поколение архитектуры: Ada против Ampere, то есть FP8 и Transformer Engine против их отсутствия. По спецификации L40S восьмибитные вычисления дают 733 TFLOPS против 362 в FP16 — вдвое. Если ваш пайплайн этим пользуется, доплата в 1.6 раза окупается. Если нет, вы оплачиваете простаивающий блок.
В обратную сторону работает NVLink: он есть только у A6000, и для многокарточного обучения это решающий довод.
Проверить свою нагрузку дешевле, чем рассуждать о ней: час аренды A6000 стоит 82.79 ₽, и одного прогона хватает, чтобы увидеть, во что упирается задача. Экономика выбора между арендой и покупкой посчитана отдельно в разборе TCO.
Нужна карта на 48 ГБ?
RTX A6000 от 82.79 ₽/час, RTX 6000 Ada и L40S с поддержкой FP8. Оплата поминутная, окружение настроено.
Посмотреть карты на 48 ГБ