NVIDIA A100 vs RTX 4090 для Deep Learning: что выбрать под задачу

Сравниваем A100 80GB PCIe и RTX 4090 по спецификациям NVIDIA: объём памяти, пропускная способность, поддержка FP8 и скорость обмена между картами. Разбираем, где какая карта уместна.

YouGPU Team Обновлено: 5 мин

TL;DR — Кратко:

  • Выбор определяет не скорость чипа, а объём памяти: 80 ГБ против 24 ГБ решают, влезет модель или нет.
  • RTX 4090 умеет FP8, которого нет у Ampere, и по FP16 идёт вровень с A100: 330 против 312 TFLOPS.
  • Между двумя A100 PCIe работает мост NVLink на 600 ГБ/с, у 4090 остаётся только PCIe Gen4 на 64 ГБ/с.

Спор про A100 и RTX 4090 обычно сводят к цене, хотя решает не она. Карты различаются не столько скоростью вычислений, сколько объёмом памяти и тем, как быстро они обмениваются данными друг с другом. Именно эти два параметра определяют, какие задачи на карте вообще запустятся.

Ниже сравнение по официальным спецификациям NVIDIA и разбор трёх сценариев, в которых ответ получается разным. Общая методика подбора карты, от узкого места задачи к строке в спецификации, разобрана в отдельном материале.

Важная оговорка про модификации: A100 выпускается в двух вариантах, PCIe и SXM, и они отличаются по пропускной способности и потреблению. Здесь везде рассматривается PCIe-версия на 80 ГБ — та, что ставится в обычные серверы.

Характеристики по спецификациям NVIDIA

ХарактеристикаA100 80GB PCIeRTX 4090
Память80 ГБ HBM2e24 ГБ GDDR6X
Пропускная способность1 935 ГБ/с1 008 ГБ/с
FP16 Tensor Core312 TFLOPS330 TFLOPS
FP8нет (архитектура Ampere)есть
Обмен между картамиNVLink-мост на 2 GPU: 600 ГБ/столько PCIe Gen4: 64 ГБ/с
Потребление (TDP)300 Вт450 Вт

Источники: страница A100 на сайте NVIDIA и спецификации RTX 4090. Значения FP16 приведены без разрежённости, чтобы сравнение было корректным.

Из таблицы видно главное: по чистой скорости вычислений в FP16 карты идут вровень, разрыв в 6% в пользу 4090. Расходятся они в памяти, в пропускной способности и в возможности работать в связке.

Про FP8. Ada Lovelace поддерживает восьмибитные вычисления, которых у Ampere нет. Для инференса квантованных моделей это заметное преимущество 4090, и оно не отражается в цифрах FP16.

Обучение: всё упирается в память

При обучении ограничителем выступает не скорость чипа, а объём VRAM. Модель, которая не помещается, не запустится ни на какой частоте.

Дообучение 8B через LoRA. Помещается на 4090 без ухищрений. A100 справится тоже, но большая часть её памяти останется незанятой — карта будет простаивать по своему основному преимуществу.

Дообучение 70B через QLoRA. Здесь 24 ГБ уже не хватает: квантованные веса 70B занимают около 40 ГБ, что подтверждается размером GGUF-сборки llama3:70b в реестре Ollama — 39.97 ГБ. На одной 4090 такая задача не стартует. На A100 с её 80 ГБ остаётся запас под длинный контекст и увеличенный батч.

Подробный разбор того, сколько памяти требует каждый сценарий и как её экономить, есть в статье про VRAM для обучения. Практический пример дообучения на одной карте — в гайде по файн-тюнингу Llama 3.

Инференс: где выигрывает 4090

На задачах, которые помещаются в 24 ГБ, RTX 4090 обычно оказывается не медленнее, а часто быстрее.

Причин две. Первая — в FP16 у неё чуть больше вычислительной мощности, 330 TFLOPS против 312. Вторая важнее: поддержка FP8 позволяет запускать квантованные модели в формате, недоступном для Ampere.

Отсюда практический вывод: для генерации изображений и работы с моделями до 13B профессиональная карта не даёт выигрыша, за который стоило бы доплачивать. Разбор запуска квантованных моделей есть в инструкции по DeepSeek-R1.

Масштабирование: почему шина решает

Это единственный раздел, где разрыв между картами принципиальный, а не количественный.

Две карты A100 PCIe соединяются мостом NVLink со скоростью 600 ГБ/с. У RTX 4090 интерфейса NVLink нет вовсе: в спецификациях NVIDIA в строке NVLink (SLI-Ready) стоит No, разъём убран в поколении Ada. Карты 4090 обмениваются данными только через PCIe Gen4, а это 64 ГБ/с — примерно в девять раз медленнее.

При обучении градиенты синхронизируются между картами на каждом шаге. Когда объём пересылаемых данных велик, разница в скорости шины превращается в простой: карты ждут друг друга вместо того, чтобы считать. Поэтому связка из двух 4090 обычно не даёт двукратного прироста.

Ограничение и у A100 PCIe. Мост NVLink в PCIe-версии соединяет только две карты. Конфигурации на четыре и восемь GPU с полноценной связью между всеми картами — это SXM-версия в составе платформы HGX, а не набор PCIe-карт в обычном сервере.

Экономика аренды

Считаем по актуальным ценам каталога. Данные сняты 19 августа 2026 года, курс ЦБ РФ на эту дату — 85.16 ₽ за доллар:

КартаПамятьЦена отВ долларах
A100 80GB80 ГБ201.79 ₽/час$2.37/час
RTX 6000 Ada48 ГБ115.52 ₽/час$1.36/час
RTX A600048 ГБ80.43 ₽/час$0.94/час

Про RTX 4090 стоит сказать прямо: в аренду она попадается редко, и в нашем каталоге её сейчас нет. Ближайший доступный аналог по архитектуре — RTX 6000 Ada: то же поколение Ada Lovelace с поддержкой FP8, но 48 ГБ памяти вместо 24.

Если вы выбираете между покупкой карты и арендой, расчёт полной стоимости владения разобран в отдельной статье про TCO.

Три сценария

Учебные задачи и пет-проекты. Дообучение BERT, экспериментальные прогоны на 8B моделях. Профессиональная карта не нужна: задача помещается в 24 ГБ, и переплата за память не окупится.

Дообучение больших моделей. Работа с 70B на своих данных. Здесь 24 ГБ не хватает физически, и вариантов два: карта на 48 ГБ и выше либо A100 на 80 ГБ, если нужен ещё и длинный контекст с большим батчем.

Продакшен-инференс. Сервис генерации изображений или чат-бот на модели до 13B. Выигрывает архитектура Ada из-за FP8, а объём памяти уровня A100 остаётся невостребованным.

Что в итоге

Правило простое: пока задача помещается в память потребительской карты, доплачивать за A100 незачем. По вычислениям в FP16 разница около 6%, а FP8 у Ada и вовсе даёт преимущество в инференсе.

A100 берут за другое — за 80 ГБ памяти и за возможность соединить карты быстрой шиной. Как только модель перестаёт помещаться или требуется обучение на нескольких GPU, потребительские карты упираются в потолок, который не обходится настройками.

Нужна карта под большую модель?

A100 80GB для обучения 70B, RTX 6000 Ada на 48 ГБ с поддержкой FP8 для инференса. Драйверы и окружение настроены.

Выбрать карту