NVIDIA A30 24GB
Датацентровая карта на архитектуре Ampere: 24 ГБ HBM2 и 933 ГБ/с при 165 Вт. Вариант, когда модель не помещается в 16 ГБ, а объём A100 не нужен.
Характеристики Ampere
Что дают эти 24 ГБ
A30 закрывает разрыв между картами на 16 ГБ и A100. Восемь дополнительных гигабайт — это запас под длинный контекст LLM, батч побольше в диффузионных моделях и возможность не квантизировать модель там, где точность важна. При этом 165 Вт и память HBM2 с ECC — карта рассчитана на круглосуточную работу в стойке.
A30 vs Tesla V100 16GB
| Параметр | A30 | V100 16GB |
|---|---|---|
| Видеопамять | 24 GB | 16 GB |
| Пропускная способность | 933 GB/s | 900 GB/s |
| FP64 на обычных ядрах | 5.2 TFLOPS | 7–7.8 TFLOPS |
| FP64 Tensor Core | 10.3 TFLOPS | Нет |
| Форматы BF16 и TF32 | Есть | Нет (Volta) |
| Потребление (TDP) | 165 W | 250–300 W |
Ключевые особенности
MIG: до 4 инстансов
Карта делится на четыре изолированных GPU по 6 ГБ или на два по 12 ГБ — у каждого своя память, кэш и вычислительные ядра.
ECC без потери объёма
HBM2 хранит биты коррекции ошибок в отдельной области, поэтому ECC не отнимает ни ёмкости, ни пропускной способности — в отличие от inline ECC на GDDR-памяти.
Четыре декодера видео
4 блока NVDEC и аппаратный декодер JPEG снимают с процессора распаковку видео и картинок в пайплайнах аналитики и препроцессинга.
Для каких задач
Инференс LLM
Модель на 7–8B параметров в FP16 помещается вместе с KV-кэшем, а в 4-битной квантизации — до ~30B.
Генерация и распознавание
SDXL и Whisper large работают в FP16 без квантизации. FLUX.1 [dev] в BF16 целиком в 24 ГБ не помещается — его запускают в FP8.
Инженерные расчёты
10.3 TFLOPS FP64 на Tensor Core в матричных операциях и 5.2 TFLOPS на обычных ядрах — для симуляций и численных методов с двойной точностью.
Этой карты сейчас нет в наличии
Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.