Ampere, 24 ГБ HBM2

NVIDIA A30 24GB

Датацентровая карта на архитектуре Ampere: 24 ГБ HBM2 и 933 ГБ/с при 165 Вт. Вариант, когда модель не помещается в 16 ГБ, а объём A100 не нужен.

Спецификации

Характеристики Ampere

Архитектура
NVIDIA Ampere
Видеопамять
24 GB HBM2 (ECC)
Пропускная способность
933 GB/s
FP16 / BF16 Tensor Core (dense)
165 TFLOPS
FP64 Tensor Core
10.3 TFLOPS
Потребление (TDP)
165W
Сравнение

Что дают эти 24 ГБ

A30 закрывает разрыв между картами на 16 ГБ и A100. Восемь дополнительных гигабайт — это запас под длинный контекст LLM, батч побольше в диффузионных моделях и возможность не квантизировать модель там, где точность важна. При этом 165 Вт и память HBM2 с ECC — карта рассчитана на круглосуточную работу в стойке.

Пропускная способность (HBM2) 933 GB/s
У A100 40GB — 1.55 ТБ/с, у RTX A4000 на GDDR6 — 448 ГБ/с
FP64 Tensor Core 10.3 TFLOPS
В матричных операциях на Tensor Core; на обычных ядрах FP64 — 5.2 TFLOPS

A30 vs Tesla V100 16GB

ПараметрA30V100 16GB
Видеопамять24 GB16 GB
Пропускная способность933 GB/s900 GB/s
FP64 на обычных ядрах5.2 TFLOPS7–7.8 TFLOPS
FP64 Tensor Core10.3 TFLOPSНет
Форматы BF16 и TF32ЕстьНет (Volta)
Потребление (TDP)165 W250–300 W
Возможности

Ключевые особенности

MIG: до 4 инстансов

Карта делится на четыре изолированных GPU по 6 ГБ или на два по 12 ГБ — у каждого своя память, кэш и вычислительные ядра.

ECC без потери объёма

HBM2 хранит биты коррекции ошибок в отдельной области, поэтому ECC не отнимает ни ёмкости, ни пропускной способности — в отличие от inline ECC на GDDR-памяти.

Четыре декодера видео

4 блока NVDEC и аппаратный декодер JPEG снимают с процессора распаковку видео и картинок в пайплайнах аналитики и препроцессинга.

Решения

Для каких задач

Инференс LLM

Модель на 7–8B параметров в FP16 помещается вместе с KV-кэшем, а в 4-битной квантизации — до ~30B.

Генерация и распознавание

SDXL и Whisper large работают в FP16 без квантизации. FLUX.1 [dev] в BF16 целиком в 24 ГБ не помещается — его запускают в FP8.

Инженерные расчёты

10.3 TFLOPS FP64 на Tensor Core в матричных операциях и 5.2 TFLOPS на обычных ядрах — для симуляций и численных методов с двойной точностью.

Этой карты сейчас нет в наличии

Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.