Блог

Наш Блог

ComfyUI 7 мин

ComfyUI на арендованном GPU: запуск, модели и типичные отказы

Чем аренда отличается от локального запуска: временный диск, отсутствие аутентификации в ComfyUI и урезанные права Manager на нелокальном слушателе. Установка по официальной инструкции, раскладка моделей по каталогам и разбор отказов.

GPU 11 мин

Как выбрать GPU под задачу: инференс, дообучение, генерация изображений

Три задачи упираются в три разных параметра карты: инференс — в пропускную способность памяти, дообучение — в ёмкость, генерация изображений — в вычисления. Разбор с расчётом потолка скорости и спецификациями NVIDIA.

LLM 9 мин

Сколько VRAM нужно для инференса LLM: от 8B до 70B

Веса — только нижняя граница. Считаем KV-кеш по формуле: 131 КБ на токен у Llama 3.1 8B, 328 КБ у 70B, и сколько параллельных запросов остаётся на карте после загрузки модели.

Stable Diffusion 11 мин

Сколько VRAM нужно для Stable Diffusion, SDXL и Flux

Разбор по весам файлов с Hugging Face: почему SDXL укладывается в 8 ГБ, FLUX.1 требует 33.7 ГБ в bf16, а FLUX.2 [dev] — 113 ГБ, и какие приёмы снижают пик до карты, которая у вас есть.

Hardware 5 мин

NVIDIA A100 vs RTX 4090 для Deep Learning: что выбрать под задачу

Сравниваем A100 80GB PCIe и RTX 4090 по спецификациям NVIDIA: объём памяти, пропускная способность, поддержка FP8 и скорость обмена между картами. Разбираем, где какая карта уместна.

Guide 5 мин

Купить GPU или арендовать? Считаем TCO (Total Cost of Ownership)

Расчёт в рублях с точкой безубыточности в часах: когда своя карта окупается, когда выгоднее аренда и почему остаточную стоимость железа нельзя выкидывать из формулы.

Tutorial 3 мин

Файн-тюнинг Llama 3 8B: Полный гайд (Unsloth + PyTorch)

Дообучаем Llama 3 8B на своих данных через QLoRA и Unsloth: актуальная установка, рабочий код на SFTConfig и сохранение адаптеров в GGUF. Хватает одной карты на 16 ГБ.

DeepSeek 7 мин

Запуск DeepSeek-R1: Гайд по Ollama, vLLM и железу

Как поднять DeepSeek-R1 на арендованном сервере: реальные размеры моделей, выбор между Ollama и vLLM, рабочие Docker-команды и параметры, от которых зависит качество ответов.

Voice AI 7 мин

Whisper на GPU: транскрибация дешевле API OpenAI в 20 раз

Считаем стоимость минуты аудио на своём железе против whisper-1, поднимаем Faster-Whisper в Docker с рабочим прокидыванием CUDA и разбираем, что ломается в проде.

Llama 3 6 мин

Llama 3 на своем сервере: Гайд по Ollama + Docker

Поднимаем Llama 3 в связке Ollama и Open WebUI через Docker: сколько нужно VRAM, как пробросить GPU в контейнер и чем нативный API отличается от OpenAI-совместимого.

Сколько VRAM нужно для обучения нейросетей? Machine Learning 7 мин

Сколько VRAM нужно для обучения нейросетей?

Почему обучение требует в 9 раз больше памяти, чем инференс, куда уходят байты на каждый параметр и как уложить дообучение LLM в одну карту с помощью QLoRA и checkpointing.

Хватит читать — пора запускать

Разверните GPU-сервер из гайда за ~2 минуты. Поминутная оплата, root по SSH, готовое ML-окружение.

Деплой за ~2 минуты · поминутная оплата · удаление в любой момент