Ampere, 40 ГБ HBM2

NVIDIA A100 40GB

Та же архитектура Ampere и те же Tensor Core, что у старшей версии, но с 40 ГБ памяти HBM2. Вариант для задач, которым этого объёма хватает.

Характеристики

Спецификации

Архитектура
NVIDIA Ampere
VRAM
40 GB HBM2
Пропускная способность
1.55 TB/s
FP16 Tensor Core (dense)
312 TFLOPS
Интерконнект
NVLink 600 GB/s
Потребление (TDP)
250–400W
Сравнение

Когда 40 ГБ достаточно

Вычислительная часть у обеих версий A100 одинаковая: 312 TFLOPS в FP16 (dense) и Tensor Core третьего поколения. Отличаются объём и скорость памяти — а значит, разница проявляется только там, где модель или батч упираются в VRAM. Диапазоны в характеристиках — от PCIe- до SXM-версии.

  • Инференс моделей до 13B параметров в FP16 и файнтюнинг через LoRA
  • Обучение CV-моделей и диффузионных сетей
  • Научные расчёты с двойной точностью (FP64)

Сравнение версий

ХарактеристикаA100 40GBA100 80GB
Тип памятиHBM2HBM2e
Пропускная способность1.55 TB/s1.9–2.0 TB/s
FP16 Tensor Core (dense)312 TFLOPS312 TFLOPS
Предел по весам в FP16~20B params~40B params
Модель не помещается в 40 ГБ? Смотрите A100 80GB — вдвое больше памяти и более быстрая HBM2e.
Возможности

Что умеет Ampere

MIG: до 7 инстансов

Карта делится на изолированные GPU по 5 ГБ с собственной памятью и кэшем. Удобно, когда нужно развести несколько небольших сервисов.

TF32 без переписывания модели

Tensor Core третьего поколения ускоряют FP32-операции в формате TF32: в TensorFlow он включён по умолчанию, в PyTorch — вызовом torch.set_float32_matmul_precision('high').

FP64 для расчётов

9.7 TFLOPS двойной точности и 19.5 TFLOPS на Tensor Core против 1.3 TFLOPS у RTX 4090 — A100 подходит не только для нейросетей, но и для инженерных симуляций.

Решения

Для каких задач

Файнтюнинг через LoRA

Дообучение моделей на 7–13B параметров адаптерами: 40 ГБ хватает на веса, градиенты адаптеров и рабочий батч.

Инференс средних LLM

Модель на 13B параметров в FP16 занимает около 26 ГБ и помещается вместе с KV-кэшем. 70B в 4-битной квантизации (около 35 ГБ) тоже помещается, но на контекст остаётся мало памяти.

Компьютерное зрение

Обучение детекторов и сегментации, тренировка и инференс диффузионных моделей — здесь 40 ГБ редко становятся узким местом.

Этой карты сейчас нет в наличии

Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.