Для коммерческих рекламных роликов Kling AI лучше держит анатомию и сложную динамику лиц, а Luma Dream Machine превосходит конкурента в скорости генерации и работе со свободной камерой. Инструменты тестировались в продакшене в начале 2025 года; главное ограничение обеих моделей — появление «плывущих» артефактов на 4-й секунде и проблемы с мелкими деталями брендинга. Вводные задачи от заказчика и рамки нашего теста Когда клиент приносит ТЗ с формулировкой «нужно вчера и чтобы выглядело дорого», мы с дизайнером сразу отсеиваем инструменты, которые выдают случайный брак. В коммерческом ролике нельзя допускать, чтобы у актера в кадре внезапно менялся цвет глаз или количество пальцев. Мы сопоставили Kling AI и Luma Dream Machine по четырем жестким критериям продакшена: предсказуемость физики, стабильность человеческих лиц, поведение камеры и
Показать полностьюСтатьяКейс
Обучение LoRA для Flux.1 Dev через Kohya_ss: реальный тест и качество лиц
Автор отметил, что материал написан или существенно правлен с помощью ИИ (gemini-2.5-flash).
Обучение собственной LoRA для Flux.1 Dev через Kohya_ss требует мощной видеокарты уровня RTX 3090/4090 с 24 ГБ VRAM, качественного датасета из 15–30 выровненных фотографий и точной настройки множителей rank и alpha.
Метод подходит для коммерческих проектов и рекламы, где заказчик требует жесткого контроля портретного сходства, но уступает по скорости классическим SDXL-моделям и страдает от артефактов кожи при завышенных шагах.
Зачем запускать обучение Flux.1 Dev LoRA своими силами
Когда мы с дизайнером берем в работу очередной рекламный проект, заказчик редко соглашается на абстрактные генерации. Ему нужно точное попадание в лицо реального амбассадора, узнаваемый стиль или конкретный предмет из каталога. Базовая модель Flux.1 Dev великолепно понимает текст и анатомию, но не знает вашего клиента. Именно поэтому приходится уходить в локальное обучение LoRA.
Мы используем графический интерфейс Kohya_ss, так как он позволяет прозрачно контролировать все параметры процесса — от скорости обучения (learning rate) до сохранения промежуточных эпох. Это не магия одной кнопки: если выставить настройки наугад, вместо лица амбассадора модель выдаст «пластиковую» маску или начнет генерировать артефакты на руках и фоне.
- Требуется локальная видеокарта с объемом видеопамяти от 24 ГБ (RTX 3090 или RTX 4090).
- Обязательно наличие быстрой дисковой системы NVMe для быстрой подгрузки тензоров.
- Процесс завязан на связку Python, CUDA и актуальные библиотеки diffusers.
Сколько нужно фотографий и какого качества для датасета
Главная ошибка начинающих — закинуть в папку тысячу случайных кадров с телефона и надеяться на чудо. Для Flux.1 Dev критически важна чистота датасета. Мы с дизайнером собираем от 15 до 30 качественных фотографий одного человека в разных ракурсах, с разным освещением, но без сильных искажений перспективы и экстремальных эмоций, которые ломают базовую сетку лица.
Каждый кадр предварительно кадрируется и очищается от лишнего мусора на фоне, чтобы нейросеть не путала лицо с деталями одежды или интерьера. Разрешение изображений должно быть не ниже 1024х1024 пикселей. Использование подписей (captioning) обязательно: текстовые файлы с описанием каждого кадра помогают модели быстрее понять, где объект тренировки, а где случайные элементы.
- Объем датасета: 15–30 тщательно отобранных кадров.
- Разрешение: строго от 1024 пикселей по меньшей стороне.
- Разметка: текстовые `.txt` файлы с описанием содержимого для каждого изображения.
Критические параметры Kohya_ss для обучения Flux.1 Dev
Интерфейс Kohya_ss предлагает сотни ползунков, но для архитектуры Flux.1 важны лишь несколько ключевых веток. Поскольку модель использует тяжелый трансформер и текстовые энкодеры T5 и CLIP, стандартные настройки от SDXL здесь приводят к мгновенному переобучению (overfitting) или ошибкам нехватки памяти (OOM).
Мы выставляем значение network_dim (rank) на уровне 16 или 32, а network_alpha — вполовину меньше или равным rank (например, 16). Скорость обучения (learning rate) для самого веса LoRA задаем в пределах от 1e-4 до 4e-4, используя оптимизатор AdamW8bit с пониженной точностью (bf16), так как Flux.1 нативно обучается в bfloat16, что критично для стабильности градиентов.
- Network Rank (dim): 16 или 32 для оптимального баланса веса и детализации.
- Learning Rate: 1e-4 для быстрого старта без разрушения базовых слоев.
- Precision: bfloat16 (bf16) для сохранения точности вычислений на RTX 4090.
Настройка шагов обучения и предотвращение переобучения
Вопрос правильного количества шагов (steps) и эпох (epochs) всегда решается через тестовые прогонки. Если запустить обучение слишком надолго, модель потеряет гибкость: лицо станет «вшитым» в любой фон, а кожа приобретет неебливый глянец, от которого рекламу сразу завернет арт-директор.
При размере датасета в 20 картинок мы обычно выставляем общее количество повторений (repeats) около 10–15 на каждое изображение за эпоху, суммарно получая порядка 1000–1500 шагов. Сохранение весов (save_every_n_epochs) настраиваем на каждую эпоху, чтобы в ComfyUI потом протестировать промежуточные версии и выбрать ту, где портретное сходство уже максимальное, а артефактов еще нет.
- Общие шаги: ориентируйтесь на диапазон 1000–2000 шагов в зависимости от размера датасета.
- Сохранение эпох: сохраняйте веса каждые 1–2 эпохи для ручной проверки в генераторе.
- Контроль потерь (loss): следите за графиком, резкое падение loss в ноль означает переобучение.
Типичные артефакты лица и одежды при переносе LoRA в ComfyUI
Когда готовая `.safetensors` модель переносится в ноды ComfyUI для финального рендеринга, всплывают стандартные проблемы реальных запусков. Чаще всего мы сталкиваемся с тем, что глаза приобретают стеклянный блеск, а по контуру волос появляется характерный «ореол» из пикселей исходного фона датасета.
Еще одна беда — деформация одежды. Если в обучающей выборке человек был в одной и той же куртке на половине кадров, модель начинает намертво привязывать эту куртку к лицу, и вставить персонажа в строгий костюм или летнюю футболку становится проблематично. Решается это расширением разнообразия одежды в датасете или снижением веса LoRA (strength) при инференсе до 0.7–0.85.
- Стеклянный взгляд и перенасыщенная текстура кожи при высоком весе LoRA (>0.9).
- Перенос элементов фона с тренировочных фото на новые генерации.
- «Прилипание» одежды из датасета к любым текстовым промптам.
Чек-лист проверки готовой LoRA перед сдачей в рекламу
Прежде чем показывать результат заказчику или отдавать дизайнеру в работу, мы проводим стресс-тест собранной LoRA по трем сценариям. Задача — убедиться, что модель ведет себя предсказуемо в нестандартных условиях, а не только на статичных портретах анфас.
Мы проверяем генерацию в полный рост, смену освещения (например, жесткий контровой свет или неоновые вывески) и изменение эмоций. Если на этом этапе лицо плывет или теряет узнаваемость, мы снижаем вес в ComfyUI или пересобираем датасет, убирая кадры с проблемными ракурсами.
- Стресс-тест смены одежды через текстовый промпт.
- Проверка узнаваемости при боковом и сложном студийном освещении.
- Контроль целостности кистей рук и геометрии тела при активации LoRA.
Источники
Источник: https://github.com/bmaltais/kohya_ss
Комментарии (0)
Войдите, чтобы комментировать.
Без Plus — 5 комментариев в месяц. Мало слов — чистый воздух. Войти
Комментариев пока нет — будьте первым.
Ещё в теме «Изображения»
Похожие материалы и соседние разборы
Зачем подключать DeepSeek R1 к 1С своими силами Разноска банковских выписок в 1С:Бухгалтерия съедает у бухгалтера массу времени, особенно если контрагенты пишут в назначении платежа «всякую ерунду». Отправлять первичку в облачные сервисы нельзя по соображениям безопасности: коммерческая тайна и персональные данные клиентов не должны уходить на сторонние серверы. Решением становится запуск локальной языковой модели DeepSeek R1 через инструмент Ollama. В этом разборе мы опираемся на официальные спецификации моделей и открытую документацию по интеграции локального API, чтобы посчитать реальные затраты на железо и время обработки документов. Методика и ограничения полевого теста Чтобы не строить иллюзий о миллионной экономии, возьмем конкретные вводные: база 1С:Бухгалтерия предприятия, ред. 3.0, примерно 400–600 входящих платежей в месяц. Тест
Показать полностьюКороткий ответ: что дешевле для офисных задач Для базовых офисных задач по работе с текстом DeepSeek API стоит значительно дешевле OpenAI API, обеспечивая приемлемое качество при обработке писем и отчетов. По данным официальных прайс-листов на начало 2025 года, модели DeepSeek предлагают стоимость входных и выходных токенов в разы ниже, чем флагманские решения OpenAI вроде GPT-4o, хотя требуют внимательной настройки параметров интеграции. Сравнение стоимости токенов DeepSeek API и OpenAI API Когда в понедельник открываешь биллинг корпоративного аккаунта, сразу видно, куда уходят деньги отдела. Обработка сотен клиентских писем и регламентов съедает бюджет незаметно, если использовать самые дорогие модели. Официальная документация DeepSeek указывает стоимость модели DeepSeek-V3 на уровне около 0.14 доллара за миллион входных токенов (при
Показать полностьюДля точного переноса позы в коммерческом макете через Stable Diffusion WebUI используется связка расширения ControlNet версии 1.1 и специализированных весов OpenPose. Инструкция ориентирована на коммерческих дизайнеров и арт-директоров, использующих актуальные сборки WebUI (версия 1.6.0 и выше); главное ограничение — модель OpenPose не умеет достраивать скрытые за одеждой или ракурсом детали одежды, требуя ручной дорисовки скелета. Какие файлы весов нужны для OpenPose и куда их складывать в WebUI Мы с дизайнером всегда начинаем с проверки актуальности расширения в AUTOMATIC1111 и правильного размещения файлов весов. Без корректных файлов models ControlNet выдает ошибку инициализации при генерации. Для работы OpenPose требуются файлы моделей с расширением .safetensors, которые скачиваются из официального репозитория на Hugging Face. Их нужно
Показать полностьюГде сломалосьГайд
Cursor IDE не видит Python в venv: причины и исправление
Симптом: Cursor IDE не видит локальный интерпретатор Python Симптом: при открытии проекта в Cursor IDE линтер ругается на отсутствие модулей, а в правом нижнем углу или через палитру команд не удается выбрать локальный интерпретатор из папки .venv. Поведение воспроизводится при открытии нового воркспейса на базе стандартного модуля venv или Poetry без явно прописанных путей в конфигурации рабочей зоны. Причина сбоя: расхождение путей в settings.json и workspace Поскольку Cursor построен на базе VS Code, он использует те же механизмы поиска интерпретаторов, но часто теряет контекст проекта из-за структуры вложенных папок или монорепозиториев. Если в настройках воркспейса жестко не зафиксирован путь к исполняемому файлу python, сканер окружения падает по таймауту или берет дефолтную системную версию. Фиксим через ручную правку settings.json
Показать полностьюВведение в оживление фото: почему половина туториалов врет У меня на прошлой неделе горел проект: клиент принес архивные кадры из девяностых и потребовал запустить их в рилс с легким движением глаз и улыбкой. Задача классическая, но когда я полезла в первые попавшиеся туториалы из поисковика, результат выглядел так, будто на человека наложили фильтр из фильмов ужасов. Глаза разъезжаются, зубы двоятся, а вместо живой текстуры кожи — сплошная пластиковая каша. В коммерческом дизайне такой фокус не прокатит. Реклама не простит халтуры, а заказчик справедливо спросит, почему лицо выглядит жутко. Поэтому мы с дизайнером сели тестировать инструменты не по красивым тизерам на сайтах, а на реальных проблемных исходниках: старых сканах, зернистых портретах и студийных снимках с жестким светом. Ниже я собрала топ-5 нейросетей, которые действительно умеют
Показать полностью
