Блог

Наш Блог

Docker 14 мин

Проброс GPU в Docker: NVIDIA Container Toolkit

Настройка проброса GPU в Docker: установка NVIDIA Container Toolkit, конфигурация рантайма, проверка nvidia-smi в контейнере и синтаксис для Compose.

Whisper 17 мин

Сколько VRAM нужно для Whisper и других ASR-моделей

Whisper large-v2 в fp16 занимает 4.42 ГиБ при весах 2.89 ГиБ. Куда уходит разница, сколько стоит поток в батче и как считать под Parakeet и GigaAM.

CUDA 12 мин

CUDA out of memory: причины и что менять в конфиге

Четыре причины нехватки VRAM, разбор чисел из текста ошибки и параметры vLLM, Transformers и Diffusers, которые снижают пик, — с ценой каждого изменения.

NVIDIA 7 мин

RTX A6000 против L40S: что брать под инференс

Обе карты дают 48 ГБ, но L40S дороже в 1.6 раза. У L40S есть FP8 и Transformer Engine, у A6000 — NVLink, которого у L40S нет вовсе.

GPU 11 мин

Как выбрать GPU: инференс, дообучение, генерация

Инференс упирается в пропускную способность памяти, дообучение — в её объём, генерация изображений — в вычисления. Разбор с расчётом потолка скорости.

LLM 9 мин

Сколько VRAM нужно для инференса LLM: от 8B до 70B

Веса — только нижняя граница. Считаем KV-кеш: 131 КБ на токен у Llama 3.1 8B, 328 КБ у 70B, и сколько запросов остаётся на карте после загрузки.

Stable Diffusion 11 мин

Сколько VRAM для Stable Diffusion, SDXL и Flux

Разбор по весам файлов с Hugging Face: SDXL укладывается в 8 ГБ, FLUX.1 требует 33.7 ГБ в bf16, FLUX.2 [dev] — 113 ГБ. И чем снизить пик.

Hardware 5 мин

A100 vs RTX 4090 для Deep Learning: что выбрать

Сравниваем A100 80GB PCIe и RTX 4090 по спецификациям NVIDIA: объём памяти, пропускная способность, поддержка FP8 и обмен между картами.

Guide 5 мин

Купить GPU или арендовать: считаем TCO

Расчёт в рублях с точкой безубыточности в часах: когда своя карта окупается и почему остаточную стоимость железа нельзя выкидывать из формулы.

Tutorial 3 мин

Файн-тюнинг Llama 3 8B: гайд по Unsloth и QLoRA

Дообучаем Llama 3 8B на своих данных через QLoRA и Unsloth: установка, код на SFTConfig и сохранение адаптеров в GGUF. Хватит карты на 16 ГБ.

DeepSeek 7 мин

Запуск DeepSeek-R1: Гайд по Ollama, vLLM и железу

Как поднять DeepSeek-R1 на арендованном сервере: реальные размеры моделей, выбор между Ollama и vLLM и рабочие Docker-команды.

Voice AI 7 мин

Whisper на GPU: дешевле API OpenAI в 20 раз

Считаем стоимость минуты аудио против whisper-1, поднимаем Faster-Whisper в Docker с прокидыванием CUDA и разбираем, что ломается в проде.

Llama 3 6 мин

Llama 3 на своем сервере: Гайд по Ollama + Docker

Поднимаем Llama 3 в связке Ollama и Open WebUI через Docker: сколько нужно VRAM, как пробросить GPU в контейнер и какой API выбрать.

Сколько VRAM нужно для обучения нейросетей? Machine Learning 7 мин

Сколько VRAM нужно для обучения нейросетей?

Почему обучение требует в 9 раз больше памяти, чем инференс, и как уложить дообучение LLM в одну карту с помощью QLoRA и checkpointing.

Запустите GPU-сервер из гайда

Сервер поднимается за несколько минут. Поминутная оплата, доступ по SSH, готовое ML-окружение.

Оплата поминутно, минимум 10 минут · удаление в любой момент