Генерация изображений по картинке¶
Генерация изображений по картинке — это класс задач компьютерного зрения и искусственного интеллекта, при котором нейросеть создаёт новое изображение на основе входного изображения-условия (промпта-картинки). В отличие от текстовой генерации, где условие формулируется словами, здесь в качестве управляющего сигнала выступает сам визуальный контент: фотография, эскиз, схема или частично завершённый рисунок. Технология применяется для стилизации, редактирования, апскейла, перевода изображения в другой модальность (например, фото в аниме) и синтеза новых сцен с сохранением композиции.
¶Принцип работы
Современные системы генерации по картинке построены на архитектурах диффузионных моделей (diffusion models), которые в 2020-е годы вытеснили генеративно-состязательные сети (GAN) в задачах синтеза изображений высокого качества. Обучение диффузионной модели состоит из двух этапов: прямого — постепенное зашумление исходного изображения до чистого гауссова шума, и обратного — обучение сети убирать шум шаг за шагом, восстанавливая изображение.
Для генерации по картинке к базовой модели добавляется модуль условного контроля (control module), который «читает» входное изображение и передаёт его признаки в процесс генерации. Наиболее распространённые механизмы контроля:
- ControlNet — отдельная ветвь сети, обученная извлекать из входного изображения карту признаков (контур, позу, глубину, сегментацию) и направлять её в основную модель через нулевые конволюции. Предложен исследователями Стэнфордского университета в 2023 году и стал стандартом де-факто.
- IP-Adapter — модуль, преобразующий эмбеддинг входного изображения в набор «ключ-значений» (key-value tokens), которые ассоциируются с текстовым промптом через механизм cross-attention.
- Image-to-image перевод (img2img) — базовый механизм, при котором входное изображение сначала зашумляется до определённого уровня (strength), а затем модель «дорисовывает» его, сохраняя общую композицию.
- Вариационный автоэнкодер (VAE) — используется для кодирования картинки в латентное пространство, где и происходит генерация, что резко снижает вычислительные затраты.
¶Классификация задач
По характеру входного изображения и желаемого результата генерацию по картинке делят на несколько групп:
| Задача | Вход | Результат |
|---|---|---|
| Стилизация | Фото + текстовый промпт | Изображение в указанном стиле |
| Апскейл (увеличение разрешения) | Маленькое изображение | Крупное детализированное |
| Реставрация | Повреждённое фото | Восстановленное изображение |
| Сегментация-гид | Карта сегментации | Реалистичное изображение |
| Поза-гид | Скелетная разметка позы | Фигура в заданной позе |
| Перевод модальности | Фото | Аниме, рисунок, 3D-текстура |
| Inpainting | Изображение с маской | Изображение с заменённой областью |
¶История развития
Первые системы image-to-image переводов появились в 2017 году в работе Филиппа Изолы и коллег «Image-to-Image Translation with Conditional Adversarial Networks» (pix2pix), предложившей единую архитектуру для парных задач — от перевода карт в фото до сегментации. В 2018 году появился CycleGAN, позволивший обучать перевод без парных данных (например, «зима → лето»).
Революцию совершили диффузионные модели: Stable Diffusion (2022, Stability AI) открыла латентную диффузионную архитектуру с доступным весами, что породило экосистему пользовательских модификаций. В 2023 году вышли ControlNet и IP-Adapter, сделавшие контроль по картинке массовым. В 2024–2025 годах крупные лаборатории (OpenAI с DALL-E 3 и GPT-4o, Google с Imagen 3 и Gemini, Яндекс с «Шедеврум» и Kandinsky) интегрировали image-to-image генерацию в свои флагманские модели, добавив возможности точного редактирования по маске и референсу.
¶Применение
Технология получила широкое распространение в коммерческих и творческих сферах:
- Графический дизайн и реклама — быстрая генерация вариантов макетов, стилизация продуктовых фото.
- Игровая индустрия — создание текстур, концепт-артов, апскейл старых ассетов.
- Кинематограф и анимация — предвизуализация, ротоскопия, генерация раскадровок.
- Медицина — синтез синтетических данных для обучения диагностических моделей, аугментация медицинских снимков.
- Архитектура — перевод эскизов в фотореалистичные рендеры.
- Восстановление архивных фото — апскейл, раскрашивание, удаление повреждений.
¶Ограничения и этические вопросы
Технология сталкивается с рядом проблем. Модели склонны к «галлюцинациям» — добавлению несуществующих деталей, что критично для медицинских и научных применений. Существует вопрос авторских прав: системы обучены на миллионах изображений из интернета без явного согласия авторов, что привело к судебным искам против Stability AI, Midjourney и других компаний. Отдельную проблему представляет deepfake-генерация — подделка изображений реальных людей, что вынуждает регуляторов вводить обязательную маркировку синтетического контента (в России с 1 сентября 2024 года действует требование маркировать ИИ-контент).