Дообучение Stable Diffusion методом LoRA

Fine-tuning Stable Diffusion через LoRA

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1460
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1314
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    1013
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1275
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    727
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1019

Fine-tuning Stable Diffusion через LoRA

Вы потратили недели на сбор датасета из 200 изображений в уникальном стиле, но полный fine-tuning SDXL требует 24 GB VRAM и занимает часы. LoRA (Low-Rank Adaptation) решает эту проблему: адаптер весит 10–150 MB, обучается за 30–120 минут на обычной RTX 3090 и легко комбинируется с другими LoRA. Экономия времени достигает 80%, а затраты на GPU снижаются в 10 раз по сравнению с полным fine-tuning. Мы используем этот подход во всех проектах по персонализации генерации — от стилей художников до каталогов товаров. Закажите обучение LoRA под вашу задачу — мы подготовим датасет и обучим адаптер за 1–2 дня.

Почему LoRA — лучший выбор для дообучения Stable Diffusion?

LoRA изменяет лишь дельта-матрицы весов, а не всю модель, как описано в оригинальной работе LoRA: Low-Rank Adaptation of Large Language Models. Благодаря низкоранговому разложению число обучаемых параметров сокращается в 1000+ раз по сравнению с полным fine-tuning. Это даёт три ключевых преимущества: минимальный размер файла (10–150 MB), быстрое обучение (30–120 мин) и возможность комбинировать до 5 LoRA одновременно с разными весами. Для сравнения: DreamBooth требует сохранять полную модель (6–7 GB) и не поддерживает композицию стилей. LoRA обучается в 2–3 раза быстрее DreamBooth, а при комбинировании нескольких LoRA достигается качество, недоступное одной модели.

Параметр DreamBooth LoRA
Изменяет Всю модель Только дельта-матрицы
Размер результата 6–7 GB 10–150 MB
Время обучения 30–60 мин 30–120 мин
Комбинирование Нет До 5 LoRA одновременно
Применение Одна модель Любая совместимая

Как мы обучаем LoRA для ваших задач?

Процесс обучения включает несколько шагов. Сначала анализируем задачу и датасет: определяем целевой стиль или объект, минимальное количество референсов (20–200 изображений). Затем подготавливаем изображения — очистка, кроп, авто-подпись с помощью BLIP-модели. Для подписей применяем триггерное слово, что ускоряет подготовку в 5 раз. Обратите внимание: качество и разнообразие датасета важнее количества. Типичная ошибка — использовать однотипные фото, что приводит к переобучению.

Далее настраиваем гиперпараметры: rank (16–64) и alpha (половина rank), learning rate (1e-4), количество эпох (10–20). Rank 32 — универсальный выбор для большинства задач. Затем запускаем обучение, используя kohya-ss/sd-scripts на GPU с 10+ GB VRAM. После обучения тестируем — генерируем 50+ промптов, подбираем веса при комбинировании нескольких LoRA, при необходимости корректируем датасет и переобучаем.

Пример настройки для kohya-ss/sd-scripts (конфигурация для SDXL):

# kohya-ss/sd-scripts — стандарт обучения LoRA git clone https://github.com/kohya-ss/sd-scripts cd sd-scripts pip install -r requirements.txt python train_network.py \ --pretrained_model_name_or_path="stabilityai/stable-diffusion-xl-base-1.0" \ --dataset_config="dataset.toml" \ --output_dir="./lora_output" \ --output_name="my_style_v1" \ --network_module="networks.lora" \ --network_dim=32 \ --network_alpha=16 \ --learning_rate=1e-4 \ --max_train_epochs=10 \ --train_batch_size=2 \ --save_every_n_epochs=2 \ --mixed_precision="fp16" \ --xformers 
dataset.toml (нажмите для просмотра)
[general] shuffle_caption = true caption_dropout_rate = 0.05 [[datasets]] resolution = 1024 batch_size = 2 [[datasets.subsets]] image_dir = "./training_images" caption_extension = ".txt" num_repeats = 10 

Автоматическая подпись изображений с помощью BLIP

from transformers import BlipProcessor, BlipForConditionalGeneration from PIL import Image import os processor = BlipProcessor.from_pretrained("Salesforce/blip-image-captioning-large") caption_model = BlipForConditionalGeneration.from_pretrained("Salesforce/blip-image-captioning-large") def auto_caption_dataset( images_dir: str, trigger_word: str = "mystyle", style_suffix: str = "in the style of mystyle" ) -> None: for img_file in os.listdir(images_dir): if not img_file.endswith((".jpg", ".png", ".webp")): continue img = Image.open(os.path.join(images_dir, img_file)).convert("RGB") inputs = processor(img, return_tensors="pt") caption = processor.decode( caption_model.generate(**inputs, max_new_tokens=50)[0], skip_special_tokens=True ) full_caption = f"{trigger_word}, {caption}, {style_suffix}" txt_path = os.path.join(images_dir, img_file.rsplit(".", 1)[0] + ".txt") with open(txt_path, "w", encoding="utf-8") as f: f.write(full_caption) 

Как комбинировать несколько LoRA для сложных сцен?

from diffusers import StableDiffusionXLPipeline import torch pipe = StableDiffusionXLPipeline.from_pretrained( "stabilityai/stable-diffusion-xl-base-1.0", torch_dtype=torch.float16 ).to("cuda") pipe.load_lora_weights("style_lora.safetensors", adapter_name="style") pipe.load_lora_weights("character_lora.safetensors", adapter_name="character") pipe.set_adapters(["style", "character"], adapter_weights=[0.7, 0.5]) image = pipe( "mystyle character, cinematic scene, detailed background", guidance_scale=7.5, num_inference_steps=30 ).images[0] 

Что входит в работу по дообучению SD через LoRA?

Этап Описание Результат
Анализ задачи Определяем целевой стиль/объект, количество референсов Техническое задание
Подготовка датасета Очистка, кроп, авто-подпись BLIP 20–200 размеченных изображений
Обучение LoRA rank 16–64, 500–2000 шагов на GPU .safetensors файл
Тестирование Генерация 50+ промптов, подбор весов Демо-примеры
Документация Инструкция по использованию LoRA markdown-файл

Типичные примеры использования LoRA

Для стиля художника требуется 50–200 изображений в целевом стиле — LoRA воспроизводит его на новых промптах. Например, для стиля «киберпанк-арт» достаточно 80 изображений с высоким rank (64). Для конкретного продукта нужно 20–50 фото товара с подписями — LoRA генерирует товар в разных сценах. Мы применяли такой подход для каталога мебели: одна LoRA заменила 3 часа ручной фотосъёмки. Для персонажа (аниме или игра) — 30–100 изображений персонажа, LoRA воспроизводит его в разных позах. Комбинируя с LoRA стиля, создаём уникальные арты.

Сроки и стоимость

Ориентировочные сроки: обучение одной LoRA (1000 шагов на RTX 3090) — 20–40 минут. Полноценный сервис с пользовательским обучением — 3–4 недели. Стоимость рассчитывается индивидуально — свяжитесь с нами, оценим ваш проект бесплатно.

Наш опыт: более 5 лет в AI/ML, десятки успешных проектов по fine-tuning для разных отраслей. Гарантируем качество обучения и поддержку всех популярных моделей: SDXL, SD 1.5, SD 3, FLUX.1. Получите консультацию — поможем подобрать оптимальные параметры обучения под ваш датасет.