Вдвое больше памяти

NVIDIA Tesla V100 32GB

Та же Volta и та же память HBM2 на 900 ГБ/с, но 32 ГБ вместо 16. Вариант для задач, которые упираются в объём, а не в скорость вычислений.

Спецификации

Характеристики Volta

Архитектура
NVIDIA Volta
Видеопамять
32 GB HBM2 (ECC)
Пропускная способность
900 GB/s
CUDA Cores
5,120
FP64 (PCIe / SXM2)
7 / 7.8 TFLOPS
Tensor Core, dense (PCIe / SXM2)
112 / 125 TFLOPS
Сравнение

Когда нужны именно 32 ГБ

Вычислительно это та же карта, что и V100 16GB: одинаковые 5120 ядер CUDA, 640 тензорных ядер и 900 ГБ/с. Разница только в объёме — и она решает, когда модель или батч не помещаются. Имейте в виду: Volta не поддерживает форматы BF16 и TF32, появившиеся в Ampere, поэтому смешанная точность здесь — это FP16 с масштабированием градиентов.

Пропускная способность (HBM2) 900 GB/s
Столько же, сколько у 16-гигабайтной версии
Обмен между картами (SXM2) 300 GB/s
У PCIe-версии — 32 ГБ/с через шину Gen3

V100 32GB vs V100 16GB

Параметр32GB16GB
Видеопамять32 GB16 GB
Пропускная способность900 GB/s900 GB/s
CUDA / Tensor Cores5,120 / 6405,120 / 640
Модель 13B в FP16ПомещаетсяНужна квантизация
Потребление (TDP)250–300 W250–300 W
Возможности

Ключевые особенности

32 ГБ на той же шине

Объём вдвое больше, чем у 16-гигабайтной версии, а пропускная способность прежняя — 900 ГБ/с. Версии различаются только объёмом памяти.

NVLink в версии SXM2

300 ГБ/с между картами против 32 ГБ/с у PCIe Gen3. На многокарточных задачах обмен данными между картами идёт почти в 10 раз быстрее.

Полноценный FP64

7–7.8 TFLOPS двойной точности в зависимости от версии — у игровой RTX 4090 около 1.3 TFLOPS.

Решения

Для каких задач

Инференс LLM до 13B

Модель на 13B параметров в FP16 занимает около 26 ГБ и помещается целиком — без квантизации и выгрузки слоёв.

Обучение с большим батчем

Там, где на 16 ГБ приходится уменьшать batch size или включать градиентный чекпоинтинг, 32 ГБ позволяют увеличить батч и обойтись без чекпоинтинга.

Научные расчёты

Симуляции на FP64 — вычислительная гидродинамика, квантовая химия, конечно-элементный анализ — и обработка больших наборов данных в памяти.

Этой карты сейчас нет в наличии

Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.