NVIDIA GB300 Grace Blackwell Ultra
Суперчип, в котором процессор Grace соединён с двумя GPU Blackwell Ultra через NVLink-C2C: 288 ГБ HBM3e на GPU при 8 ТБ/с.
Характеристики на один GPU
Чем GB300 отличается от B300
Ускоритель тот же — Blackwell Ultra. Разница в обвязке: вместо x86-процессора, связанного с GPU по PCIe, здесь Grace CPU на архитектуре Arm, соединённый с GPU через NVLink-C2C на 900 ГБ/с. Процессор и ускоритель работают с общей когерентной памятью, поэтому данные не копируются через PCIe. Пиковые значения тоже различаются: по спецификациям NVIDIA у GPU в GB300 NVL72 — 15 PFLOPS NVFP4 dense, в HGX B300 — 13.5 PFLOPS. Обратная сторона — весь софт должен быть собран под aarch64.
- Память Grace как продолжение VRAM LPDDR5X процессора доступна GPU когерентно — туда выносят то, что не поместилось в HBM3e.
- Сборки под aarch64 Docker-образы и бинарные пакеты нужны в сборке linux/arm64. Готовые приложения из каталога YouGPU собраны под x86-64 и на GB300 не запускаются.
GB300 vs HGX B300
| Параметр | GB300 | B300 |
|---|---|---|
| Ускоритель | Blackwell Ultra | Blackwell Ultra |
| NVFP4 dense на GPU | 15 PFLOPS | 13.5 PFLOPS |
| Процессор | Grace (Arm) | x86 |
| Связь CPU ↔ GPU | NVLink-C2C | PCIe |
| Память хоста для GPU | Когерентная | Через копирование |
| Сборки софта | aarch64 | x86-64 |
Ключевые особенности
Grace вместо x86
В суперчипе один Grace CPU на две карты, связанный с ними через NVLink-C2C с когерентной памятью. Процессор здесь Arm — образы и Docker-контейнеры нужны под aarch64.
288 ГБ на одну карту
Модель на 405B параметров в FP4 занимает около 230 ГБ и помещается в одну карту — без шардинга на несколько GPU и обмена данными между ними.
Tensor Core пятого поколения
NVFP4: 15 PFLOPS dense на GPU против 10 PFLOPS у Blackwell, по данным NVIDIA.
Для каких задач
Инференс reasoning-моделей
Модели с длинной цепочкой рассуждений упираются в память под KV-кэш — здесь её 288 ГБ на GPU при 8 ТБ/с.
Обучение больших моделей
FP8 и NVFP4 на Tensor Core пятого поколения, 288 ГБ на GPU под веса, градиенты и состояния оптимизатора.
Длинный контекст и RAG
Память Grace когерентно доступна GPU, поэтому эмбеддинги и индексы не приходится копировать через PCIe.
Этой карты сейчас нет в наличии
Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.