NVIDIA Tesla V100 32GB
Та же Volta и та же память HBM2 на 900 ГБ/с, но 32 ГБ вместо 16. Вариант для задач, которые упираются в объём, а не в скорость вычислений.
Характеристики Volta
Когда нужны именно 32 ГБ
Вычислительно это та же карта, что и V100 16GB: одинаковые 5120 ядер CUDA, 640 тензорных ядер и 900 ГБ/с. Разница только в объёме — и она решает, когда модель или батч не помещаются. Имейте в виду: Volta не поддерживает форматы BF16 и TF32, появившиеся в Ampere, поэтому смешанная точность здесь — это FP16 с масштабированием градиентов.
V100 32GB vs V100 16GB
| Параметр | 32GB | 16GB |
|---|---|---|
| Видеопамять | 32 GB | 16 GB |
| Пропускная способность | 900 GB/s | 900 GB/s |
| CUDA / Tensor Cores | 5,120 / 640 | 5,120 / 640 |
| Модель 13B в FP16 | Помещается | Нужна квантизация |
| Потребление (TDP) | 250–300 W | 250–300 W |
Ключевые особенности
32 ГБ на той же шине
Объём вдвое больше, чем у 16-гигабайтной версии, а пропускная способность прежняя — 900 ГБ/с. Версии различаются только объёмом памяти.
NVLink в версии SXM2
300 ГБ/с между картами против 32 ГБ/с у PCIe Gen3. На многокарточных задачах обмен данными между картами идёт почти в 10 раз быстрее.
Полноценный FP64
7–7.8 TFLOPS двойной точности в зависимости от версии — у игровой RTX 4090 около 1.3 TFLOPS.
Для каких задач
Инференс LLM до 13B
Модель на 13B параметров в FP16 занимает около 26 ГБ и помещается целиком — без квантизации и выгрузки слоёв.
Обучение с большим батчем
Там, где на 16 ГБ приходится уменьшать batch size или включать градиентный чекпоинтинг, 32 ГБ позволяют увеличить батч и обойтись без чекпоинтинга.
Научные расчёты
Симуляции на FP64 — вычислительная гидродинамика, квантовая химия, конечно-элементный анализ — и обработка больших наборов данных в памяти.
Этой карты сейчас нет в наличии
Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.