RTX A6000 против L40S: что брать под инференс на 48 ГБ

Обе карты дают 48 ГБ, но L40S дороже в 1.6 раза. Разбор по спецификациям NVIDIA: у L40S есть FP8 и Transformer Engine, у A6000 — NVLink, которого у L40S нет вовсе.

YouGPU Team 7 мин

TL;DR — Кратко:

  • Объём памяти у карт одинаковый — 48 ГБ GDDR6 с ECC. Разница в цене каталога ровно в 1.6 раза, и она не про память.
  • L40S построена на Ada Lovelace и умеет FP8: 733 TFLOPS против 362 в FP16. У A6000 архитектура Ampere, FP8 в ней нет.
  • NVLink есть только у A6000 — до 112 ГБ/с на пару карт. В спецификации L40S в строке NVLink стоит No.

Две карты с одинаковым объёмом памяти, разница в цене — в полтора раза с лишним. Вопрос «за что доплата» возникает у всех, кто выбирает сервер на 48 ГБ, и ответ на него не в характеристиках памяти.

По объёму карты неразличимы: 48 ГБ GDDR6 с коррекцией ошибок у обеих. Набор моделей, который в них помещается, совпадает полностью. Расходятся они в двух местах — в поддержке восьмибитных вычислений и в возможности работать в связке.

Ниже сравнение по спецификациям с сайта NVIDIA, расчёт разницы в деньгах и разбор того, в каком сценарии каждая карта оказывается правильным выбором.

Что различается по спецификациям

ХарактеристикаRTX A6000L40S
АрхитектураAmpereAda Lovelace
Память48 ГБ GDDR6 с ECC48 ГБ GDDR6 с ECC
Пропускная способностьNVIDIA не публикует864 ГБ/с
FP16 Tensor CoreNVIDIA не публикует362.05 TFLOPS
FP8 Tensor Coreнет в архитектуре733 TFLOPS
Transformer Engineнетесть
NVLink2-way, до 112 ГБ/с«NVLink Support: No»
ШинаPCI Express Gen 4 x16PCI Express Gen 4 x16
Потребление300 Вт350 Вт
Цена каталогаот 82.79 ₽/часот 132.46 ₽/час

Источники: страница RTX A6000 и страница L40S на сайте NVIDIA. Значения TFLOPS у L40S приведены без разрежённости, чтобы сравнение было корректным: с ней в спецификации стоит 733 для FP16 и 1 466 для FP8. Цены каталога сняты 19 августа 2026 года, указано минимальное предложение за один GPU.

Две строки таблицы решают выбор, остальные — фон.

FP8: главное, за что доплата

Ada Lovelace умеет считать в восьмибитной точности и несёт Transformer Engine, Ampere — нет. Это не настройка и не вопрос версии драйвера, а разница на уровне архитектуры.

В цифрах разрыв виден по спецификации L40S: 362.05 TFLOPS в FP16 против 733 TFLOPS в FP8, то есть ровно вдвое. Для нагрузок, которые упираются в вычисления, это прямое удвоение потолка.

Где это важно:

Генерация изображений. Диффузионная модель делает от 4 до 50 шагов сэмплирования на изображение, и каждый шаг — вычислительная нагрузка. Здесь FP8 работает напрямую в скорость. Раскладка по моделям и требованиям к памяти — в справочнике по VRAM для Stable Diffusion, SDXL и Flux.

Инференс LLM в квантованных форматах. Веса в FP8 занимают вдвое меньше места, чем в bf16, и читаются вдвое быстрее. На A6000 такую сборку тоже можно запустить, но вычисления пойдут через приведение к более широкому формату, и выигрыш будет только по памяти, не по скорости.

Где не важно:

Обучение и дообучение в bf16. Если пайплайн не переводится на восьмибитные вычисления, Transformer Engine простаивает, и доплата за него не отбивается.

NVLink: единственное, где впереди A6000

Обратная сторона. У A6000 есть мост на две карты с пропускной способностью до 112 ГБ/с — это указано в её спецификации. В спецификации L40S в строке NVLink стоит прямое No.

Разница проявляется ровно в одном сценарии — когда карт больше одной и они обмениваются данными на каждом шаге. При обучении градиенты синхронизируются постоянно, и обмен по PCIe вместо NVLink становится узким местом. Подробнее этот механизм разобран в сравнении A100 и RTX 4090.

Для инференса на одной карте NVLink не даёт ничего. Для тензорного параллелизма при инференсе на двух картах — даёт, но эффект заметно меньше, чем при обучении: обмен идёт реже.

Чего NVIDIA не публикует

Отдельно стоит сказать про пустые ячейки в таблице, потому что при сравнении спецификаций это сбивает.

На странице RTX A6000 нет ни пропускной способности памяти, ни показателей Tensor Core. Список характеристик там ограничен объёмом памяти, разъёмами, форм-фактором, шиной, NVLink и потреблением. Страницы линейки для дата-центров, включая L40S, публикуют и полосу, и TFLOPS по каждому формату.

Практический вывод: сравнивать эти две карты по цифрам производительности напрямую по официальным источникам не получается. Сопоставимы только те параметры, которые вендор приводит для обеих, — объём памяти, шина, NVLink и потребление. Цифры для A6000, которые ходят по обзорам, к первоисточнику не привязаны, и опираться на них при выборе не стоит.

Что из этого следует для решения: выбирайте по архитектурной разнице, которая задокументирована, а не по сравнению чисел, половины которых нет.

Сколько стоит разница

Цены каталога на 19 августа 2026 года, минимальное предложение за один GPU:

РежимRTX A6000L40SРазница
Час82.79 ₽132.46 ₽+49.67 ₽
Сутки1 987 ₽3 179 ₽+1 192 ₽
Месяц, 24/759 609 ₽95 371 ₽+35 762 ₽
Месяц, 8 часов в день19 870 ₽31 790 ₽+11 921 ₽

Отношение — 1.60. Вопрос, отбивается ли доплата, сводится к одному: удваивает ли FP8 вашу фактическую пропускную способность по задачам.

Если да, L40S выходит дешевле на единицу работы: платите в 1.6 раза больше за час, получаете вдвое больше сделанного. Если пайплайн не использует восьмибитные вычисления, вы платите 35 762 ₽ в месяц за неиспользуемый блок.

Проверяется это одним прогоном, а не расчётом. Общая методика подбора карты под узкое место задачи разобрана в материале про выбор GPU.

Третья карта на 48 ГБ

Сравнение двумя картами не закрывает вопрос, потому что в каталоге их три. RTX 6000 Ada — это тоже 48 ГБ GDDR6 с ECC и тоже Ada Lovelace, то есть с FP8 и Transformer Engine.

КартаАрхитектураFP8NVLinkЦена
RTX A6000Ampereнетестьот 82.79 ₽/час
RTX 6000 AdaAda Lovelaceестьнетот 118.92 ₽/час
L40SAda Lovelaceестьнетот 132.46 ₽/час

Если доплата делается именно ради FP8, RTX 6000 Ada закрывает эту потребность и стоит на 13.54 ₽/час дешевле L40S — около 9 750 ₽ в месяц при круглосуточной работе. На её странице у NVIDIA заявлено 1 457 AI TOPS в FP8 с разрежённостью, потребление 300 Вт, шина PCI Express Gen 4 x16; NVLink в списке характеристик не значится.

Оговорка та же, что и с A6000: это карта профессиональной линейки, и полосу памяти NVIDIA для неё тоже не публикует. Плюс предложений по ней в каталоге обычно меньше, чем по L40S, — проверяйте наличие на момент запуска.

Что не влияет на выбор при аренде

Три параметра, которые попадают в сравнения и при почасовой аренде ничего не решают.

Потребление. 300 Вт против 350 Вт — разница реальная, но электричество входит в стоимость часа. При покупке своей машины она бы считалась, и такой расчёт есть в разборе TCO; при аренде вы платите за час, а не за киловатты.

ECC. Коррекция ошибок есть у обеих карт, это указано в спецификации каждой. Как аргумент в пользу одной из них не работает.

Форм-фактор. Обе двухслотовые, обе с шиной PCI Express Gen 4 x16. В арендованном сервере это вообще не ваша забота.

Что брать

Инференс квантованных моделей, генерация изображений, поток запросов. Берите Ada — L40S или RTX 6000 Ada. FP8 здесь отбивает разницу в цене. Сколько запросов выдержит карта на 48 ГБ и как считается запас под KV-кеш — в справочнике по VRAM для инференса LLM.

Дообучение на двух картах. Берите A6000. Это единственная из трёх с NVLink, и в многокарточном обучении обмен по PCIe станет ограничением.

Задаче нужен только объём, скорость вторична. Берите A6000. По памяти карты идентичны, а стоит она в 1.6 раза меньше.

Не уверены. Берите A6000 на пробный прогон. Если упираетесь в вычисления, а не в память, это будет видно по загрузке карты, и тогда переход на Ada оправдан цифрами.

Что в итоге

Разница в цене между A6000 и L40S — не про память. Объём у них одинаковый, и список моделей, которые в них помещаются, совпадает.

Доплата покрывает поколение архитектуры: Ada против Ampere, то есть FP8 и Transformer Engine против их отсутствия. По спецификации L40S восьмибитные вычисления дают 733 TFLOPS против 362 в FP16 — вдвое. Если ваш пайплайн этим пользуется, доплата в 1.6 раза окупается. Если нет, вы оплачиваете простаивающий блок.

В обратную сторону работает NVLink: он есть только у A6000, и для многокарточного обучения это решающий довод.

Проверить свою нагрузку дешевле, чем рассуждать о ней: час аренды A6000 стоит 82.79 ₽, и одного прогона хватает, чтобы увидеть, во что упирается задача. Экономика выбора между арендой и покупкой посчитана отдельно в разборе TCO.

Нужна карта на 48 ГБ?

RTX A6000 от 82.79 ₽/час, RTX 6000 Ada и L40S с поддержкой FP8. Оплата поминутная, окружение настроено.

Посмотреть карты на 48 ГБ