Grace + Blackwell Ultra

NVIDIA GB300 Grace Blackwell Ultra

Суперчип, в котором процессор Grace соединён с двумя GPU Blackwell Ultra через NVLink-C2C: 288 ГБ HBM3e на GPU при 8 ТБ/с.

Спецификации

Характеристики на один GPU

Архитектура
Grace Blackwell Ultra
Видеопамять
288 GB HBM3e
Пропускная способность
8 TB/s
NVFP4 Tensor Core (dense)
15 PFLOPS
Процессор Grace на 2 GPU
72 ядра Arm Neoverse V2
NVLink на GPU
1.8 TB/s
Сравнение

Чем GB300 отличается от B300

Ускоритель тот же — Blackwell Ultra. Разница в обвязке: вместо x86-процессора, связанного с GPU по PCIe, здесь Grace CPU на архитектуре Arm, соединённый с GPU через NVLink-C2C на 900 ГБ/с. Процессор и ускоритель работают с общей когерентной памятью, поэтому данные не копируются через PCIe. Пиковые значения тоже различаются: по спецификациям NVIDIA у GPU в GB300 NVL72 — 15 PFLOPS NVFP4 dense, в HGX B300 — 13.5 PFLOPS. Обратная сторона — весь софт должен быть собран под aarch64.

  • Память Grace как продолжение VRAM LPDDR5X процессора доступна GPU когерентно — туда выносят то, что не поместилось в HBM3e.
  • Сборки под aarch64 Docker-образы и бинарные пакеты нужны в сборке linux/arm64. Готовые приложения из каталога YouGPU собраны под x86-64 и на GB300 не запускаются.

GB300 vs HGX B300

ПараметрGB300B300
УскорительBlackwell UltraBlackwell Ultra
NVFP4 dense на GPU15 PFLOPS13.5 PFLOPS
ПроцессорGrace (Arm)x86
Связь CPU ↔ GPUNVLink-C2CPCIe
Память хоста для GPUКогерентнаяЧерез копирование
Сборки софтаaarch64x86-64
Возможности

Ключевые особенности

Grace вместо x86

В суперчипе один Grace CPU на две карты, связанный с ними через NVLink-C2C с когерентной памятью. Процессор здесь Arm — образы и Docker-контейнеры нужны под aarch64.

288 ГБ на одну карту

Модель на 405B параметров в FP4 занимает около 230 ГБ и помещается в одну карту — без шардинга на несколько GPU и обмена данными между ними.

Tensor Core пятого поколения

NVFP4: 15 PFLOPS dense на GPU против 10 PFLOPS у Blackwell, по данным NVIDIA.

Решения

Для каких задач

Инференс reasoning-моделей

Модели с длинной цепочкой рассуждений упираются в память под KV-кэш — здесь её 288 ГБ на GPU при 8 ТБ/с.

Обучение больших моделей

FP8 и NVFP4 на Tensor Core пятого поколения, 288 ГБ на GPU под веса, градиенты и состояния оптимизатора.

Длинный контекст и RAG

Память Grace когерентно доступна GPU, поэтому эмбеддинги и индексы не приходится копировать через PCIe.

Этой карты сейчас нет в наличии

Наличие зависит от провайдеров. Карты, которые можно арендовать сейчас, — в каталоге.