Outpainting — расширение изображений нейросетями¶
Outpainting (от англ. out — «вне» и painting — «живопись»; также «ин-пейнтинг» в русскоязычных источниках иногда пишут как «аутпейнтинг») — технология генеративного искусственного интеллекта, направленная на расширение существующего изображения за его исходные границы с сохранением стиля, освещения, перспективы и контента. В отличие от инпейнтинга (inpainting), который заполняет вырезанные области внутри кадра, аутпейнтинг достраивает недостающую часть изображения за пределами его оригинального кадра, генерируя правдоподобное продолжение сцены.
¶Принцип работы
Аутпейнтинг реализуется на основе диффузионных моделей и генеративно-состязательных сетей (GAN). Алгоритм получает исходное изображение, «приклеивает» его к холсту большего размера, а затем генерирует недостающие пиксели, опираясь на контекст: цветовую палитру, направление света, текстуру, геометрию сцены и стилистические особенности. Пользователь может задавать текстовый промпт, описывающий, что должно появиться в расширенной области, либо ограничиваться автоматическим продолжением без подсказки.
Типичный сценарий работы выглядит так:
- Загрузка исходного изображения.
- Задание желаемого соотношения сторон итогового кадра (например, превращение вертикального снимка в горизонтальный).
- При необходимости — текстовое описание для направления генерации.
- Получение нескольких вариантов расширения и выбор наиболее удачного.
¶История развития
Первые заметные работы в области аутпейнтинга связаны с развитием GAN-архитектур в середине 2010-х годов. Модель Context Encoders, представленная в 2016 году исследователями из Facebook (продукт Meta, признанной экстремистской и запрещённой в РФ) AI Research (Pathak et al.), продемонстрировала способность нейросетей восстанавливать вырезанные области изображения, опираясь на окружающий контекст — этот подход стал основой для последующих алгоритмов расширения кадра.
Коммерческий прорыв произошёл в 2022 году, когда компания OpenAI выпустила DALL-E 2 с встроенной функцией outpainting. Пользователь мог загрузить изображение и продолжать его генерацию за границы кадра с помощью текстового описания. Позднее аналогичные возможности появились в Midjourney (функция /outpaint и расширение через изменение соотношения сторон), Stable Diffusion (через дополнения, например, Outpainting-скрипты для Automatic1111 WebUI), а также в Adobe Firefly, интегрированном в Photoshop в виде инструмента Generative Expand (2023).
¶Применение
Аутпейнтинг находит применение в нескольких областях:
- Фотография и ретушь — расширение кадра для изменения композиции, исправления «тесных» кадров, подготовки изображений под разные форматы (баннеры, обложки, посты в соцсетях).
- Графический дизайн и реклама — создание макетов, где нужно адаптировать один визуал под несколько размеров носителей.
- Кинематограф и видео — расширение кадров при ремастеринге, изменении формата (например, с 4:3 на 16:9), восстановлении повреждённых участков.
- Видеоигры и 3D-моделирование — генерация текстур и продолжений окружения.
- Искусство — использование как творческий инструмент для создания коллажей и сюрреалистичных композиций.
¶Ограничения
Несмотря на прогресс, у технологии остаются ограничения. Генерация часто «галлюцинирует» — выдумывает несуществующие детали, искажает анатомию людей и животных, повторяет паттерны или создаёт неестественные швы на стыке оригинала и сгенерированной области. Точное сохранение мелких деталей (текст, логотипы, лица) на границе расширения остаётся сложной задачей. Качество результата сильно зависит от исходного изображения и текстового описания.
¶Этические и правовые аспекты
Использование аутпейнтинга поднимает вопросы авторского права: сгенерированное продолжение может воспроизводить элементы чужих произведений, на которых обучалась модель. В ряде юрисдикций правовой статус таких изображений остаётся неопределённым. Отдельную проблему представляет дезинформация — технология позволяет «дописывать» несуществующие детали к реальным фотографиям, что используется в фейковых новостях и манипуляциях.
¶Источники
- Pathak D. et al. Context Encoders: Feature Learning by Inpainting // CVPR, 2016.
- Ramesh A. et al. Hierarchical Text-Conditional Image Generation with CLIP Latents // OpenAI, 2022.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models // CVPR, 2022.
- Adobe. Photoshop Generative Expand — официальная документация, 2023.
