Открыть сервис

Технология Outpainting

Outpainting (от англ. out — «вне» и painting — «рисование»; также известен как инпейнтинг за пределами изображения, экстраполяция изображения) — это технология генеративного искусственного интеллекта (ИИ), позволяющая расширять границы исходного цифрового изображения за счёт синтеза новых пикселей за пределами его оригинальной области. В отличие от инпейнтинга (inpainting), который заполняет удалённые или повреждённые участки внутри изображения, outpainting создаёт визуальный контент, логически продолжающий сюжет, стиль, текстуры и освещение исходного кадра, тем самым увеличивая его поле зрения или изменяя композицию.

История развития

Технология outpainting стала возможной благодаря прогрессу в области глубокого обучения, в частности, разработке диффузионных моделей (diffusion models) и генеративно-состязательных сетей (GAN). Первые значимые реализации появились в 2021–2022 годах, когда исследователи начали адаптировать модели, предназначенные для инпейнтинга, к задаче расширения изображения.

Ключевым этапом стал выпуск в 2022 году модели DALL-E 2 (компания OpenAI), которая одной из первых продемонстрировала возможность outpainting в коммерческом продукте. Пользователи могли загрузить изображение и указать область для расширения, после чего ИИ дорисовывал недостающие части. Однако функционал был ограничен размером выходного изображения (1024×1024 пикселя).

В 2023 году компания Stability AI (разработчик Stable Diffusion) представила специализированную модель Stable Diffusion XL (SDXL), которая значительно улучшила качество outpainting за счёт большей разрешающей способности и лучшего понимания контекста. Параллельно с этим сообщество разработчиков создало множество инструментов и плагинов (например, для графического редактора GIMP или Adobe Photoshop), автоматизирующих процесс.

В 2024 году технология outpainting стала стандартной функцией во многих генеративных ИИ-сервисах, таких как Midjourney, Adobe Firefly, Kandinsky (разработка «Сбера») и других. Современные реализации позволяют многократно расширять изображение, создавая панорамы или изменяя соотношение сторон без потери качества.

Принцип работы

Технология outpainting базируется на тех же архитектурах, что и генерация изображений по текстовому описанию, но с дополнительными ограничениями:

  1. Кондиционирование (Conditioning): Модель получает на вход исходное изображение (или его часть) и текстовый промпт (описание желаемого расширения). В некоторых реализациях текстовый промпт может быть необязательным — модель пытается экстраполировать содержимое на основе анализа исходного изображения.
  2. Маскирование (Masking): Область, подлежащая расширению, маскируется (например, закрашивается чёрным цветом). Модель должна сгенерировать пиксели только в этой маскированной зоне, сохраняя нетронутыми оригинальные пиксели.
  3. Генерация с учётом контекста: Диффузионная модель итеративно добавляет шум к маскированной области, а затем «очищает» его, ориентируясь на:
  • Семантическую согласованность: Содержимое расширения должно соответствовать сюжету (например, если на исходном фото изображена часть лица, outpainting должен дорисовать остальную часть головы, а не, скажем, дерево).
  • Стилистическую согласованность: Цветовая гамма, текстуры, мазки кисти (для рисунков), освещение и тени должны быть идентичны исходному изображению.
  • Пространственную согласованность: Перспектива, пропорции объектов и линия горизонта должны быть сохранены.
  1. Постобработка: После генерации часто применяются алгоритмы сглаживания границ (blending) между оригиналом и сгенерированной областью, чтобы переход был незаметным.

Классификация и виды

Outpainting можно классифицировать по нескольким параметрам:

По способу реализации

  • Автоматический (беспромптный): Модель сама решает, что должно быть на расширенной области, анализируя только исходное изображение. Результат может быть непредсказуемым.
  • Управляемый (с промптом): Пользователь задаёт текстовое описание того, что должно появиться в новой области (например, «добавь облака на небе» или «продолжи стол влево»). Это даёт больше контроля.
  • Многократный (циклический): Изображение расширяется несколько раз, каждый раз используя предыдущий результат как исходное. Позволяет создавать большие панорамы (например, 360-градусные виды) или бесконечные ленты.

По типу расширения

  • Горизонтальное (панорамное): Расширение влево или вправо. Часто используется для создания панорамных снимков из кадрированных.
  • Вертикальное: Расширение вверх (например, добавление неба) или вниз (добавление земли/пола).
  • Диагональное и произвольное: Расширение в любом направлении, включая углы.
  • Изменение соотношения сторон: Расширение для перехода, например, с квадратного формата (1:1) на широкоэкранный (16:9).

Применение

Технология outpainting нашла широкое применение в различных сферах:

  • Фотография и ретушь: Восстановление старых или повреждённых фотографий, где часть изображения утрачена. Исправление неудачной композиции (обрезка слишком близко к объекту). Создание панорам из одиночных снимков.
  • Графический дизайн: Создание макетов для баннеров, плакатов и веб-сайтов, где требуется изменить формат изображения без потери ключевых элементов. Генерация фонов для портретов или продуктов.
  • Искусство и иллюстрация: Художники используют outpainting для расширения своих работ, добавления контекста или создания альтернативных версий композиции. Технология позволяет «заглянуть за рамки» картины.
  • Кино и анимация: В постпродакшене outpainting применяется для расширения кадра, чтобы убрать лишние объекты (например, микрофоны, осветительное оборудование) или добавить визуальные эффекты.
  • Архитектура и дизайн интерьеров: Визуализация проектов: расширение фотографии фасада здания или комнаты для показа окружения или соседних помещений.
  • Образование и наука: Реконструкция изображений в археологии и палеонтологии (например, дорисовка недостающих фрагментов ископаемых).

Ограничения и критика

Несмотря на впечатляющие возможности, технология outpainting имеет ряд ограничений:

  • Несогласованность: При расширении на большие расстояния модель может «забыть» исходный контекст и начать генерировать бессмысленные или повторяющиеся паттерны (например, бесконечные ряды окон).
  • Артефакты: На границе между оригиналом и сгенерированной областью могут возникать видимые швы, искажения текстур или цветовые различия.
  • Зависимость от качества исходника: Если исходное изображение низкого разрешения или содержит шум, outpainting может его усилить.
  • Этические проблемы: Технология может быть использована для создания дипфейков, подделки документов или распространения дезинформации (например, добавление несуществующих объектов на реальные фотографии).
  • Авторское право: Генерация контента, стилистически близкого к работам конкретных художников или фотографов, поднимает вопросы о нарушении интеллектуальной собственности.

Примеры инструментов и сервисов

  • DALL-E 3 (OpenAI): Встроенная функция outpainting в интерфейсе ChatGPT.
  • Midjourney (Midjourney, Inc.): Поддержка outpainting через команду /pan (панорамирование) и изменение соотношения сторон.
  • Stable Diffusion (Stability AI): Реализуется через веб-интерфейсы (например, Automatic1111, ComfyUI) с использованием специализированных моделей (inpainting/outpainting checkpoints).
  • Adobe Firefly (Adobe Inc.): Инструмент «Генеративная заливка» (Generative Fill) в Adobe Photoshop позволяет расширять изображение за пределы холста.
  • Kandinsky 3.0 (Сбер): Российская нейросеть, поддерживающая функцию расширения изображения (outpainting) в сервисе «Шедеврум».
  • Clipdrop by Stability AI: Онлайн-сервис с инструментом «Uncrop» для автоматического outpainting.

Источники

  1. Saharia, C., et al. "Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding." (DALL-E 2 paper). Advances in Neural Information Processing Systems, 2022.
  2. Podell, D., et al. "Stable Diffusion XL: Improving Latent Diffusion Models for High-Resolution Image Synthesis." arXiv preprint arXiv:2307.01952, 2023.
  3. Rombach, R., et al. "High-Resolution Image Synthesis with Latent Diffusion Models." (Stable Diffusion paper). Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022.
  4. Документация и блоги компаний OpenAI, Stability AI, Adobe Inc., Midjourney, Inc., Сбер.
  5. Обзорные статьи на ресурсах Towards Data Science, Hugging Face Blog, Habr.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →