Генеративные изображения¶
Генеративные изображения (нейросетевые картинки) — изображения, создаваемые программами на основе искусственного интеллекта по текстовому описанию (промпту), эскизу или другому входному сигналу. К началу 2020-х годов генеративные изображения стали массовым явлением: их используют в дизайне, рекламе, образовании, журналистике и развлечениях, а качество снимков и иллюстраций, созданных нейросетями, на многих задачах приблизилось к фотографическому.
¶Технологии генерации
Современные системы генерации изображений строятся на архитектурах глубокого обучения. Ключевую роль сыграли генеративно-состязательные сети (GAN), предложенные Яном Гудфеллоу в 2014 году: одна сеть генерирует изображение, вторая — отличает подделку от оригинала, в результате чего качество генерации растёт. Позднее основой стали диффузионные модели — алгоритмы, которые учатся превращать шум в осмысленное изображение за счёт обратимых шагов зашумления и очистки. Именно на диффузионных архитектурах построены публичные системы Midjourney, Stable Diffusion и DALL-E.
Русскоязычный сегмент представлен, в частности, нейросетью Kandinsky (разработка «Сбера»), а также моделями «Яндекса» и других российских компаний. В 2023 году «Сбер» открыл веса Kandinsky под свободной лицензией, что позволило развивать локальные решения без обращения к зарубежным сервисам.
¶Способы задания изображения
| Способ | Описание |
|---|---|
| Текстовое описание (промпт) | Пользователь описывает желаемое изображение словами: сюжет, стиль, настроение, освещение |
| Скетч или эскиз | Нейросеть дорисовывает и детализирует набросок |
| Изображение-референс | Генерация на основе существующей картинки: смена стиля, апскейл, вариации |
| Сегментация | Пользователь выделяет области и задаёт отдельные описания для каждой |
| Инпейнтинг | Заполнение вырезанной части изображения с сохранением окружения |
¶Применение
Генеративные изображения применяются в коммерческом дизайне для быстрого создания иллюстраций, макетов и рекламных материалов. Издательства и образовательные проекты используют их для визуализации абстрактных понятий и исторических сцен, которых нет в фотобанках. В играх и кинематографе нейросети генерируют концепт-арт, текстуры и раскадровки. Российские разработчики применяют генеративные модели в промышленном дизайне, архитектурной визуализации и создании обучающих материалов.
¶Авторские права и правовой статус
Правовой статус нейросетевых изображений остаётся дискуссионным. В США суды рассматривают иски художников против разработчиков моделей (в частности, против Stability AI и Midjourney) о незаконном использовании обучающих данных. В России вопрос авторских прав на генеративные изображения пока не урегулирован отдельным законодательством: по общему правилу, произведение, созданное без творческого участия человека, не признаётся объектом авторского права. Практика показывает, что нейросетевые картинки активно используются в СМИ и рекламе без единого правового режима.
¶Этические вопросы
К числу обсуждаемых проблем относятся дезинформация (генерация «фотографий» несуществующих событий), подделка документов и изображений реальных людей, а также вытеснение иллюстраторов и фотографов с рынка. Ряд сервисов добавляет в генерируемые изображения невидимые метаданные C2PA, позволяющие проверить происхождение файла. В России в 2023 году внесены поправки в закон об информации, обязывающие помечать сгенерированные ИИ изображения и видео как таковые при публичном распространении.
¶Интересные факты
- В 2022 году сгенерированное нейросетью изображение «Théâtre D'opéra Spatial» получило первую премию на конкурсе искусств штата Колорадо, что вызвало споры о допустимости участия ИИ-работ.
- Диффузионные модели генерируют изображение за десятки итераций, каждая из которых убирает часть шума.
- Некоторые российские сервисы предлагают генерацию изображений в стиле русской живописи XIX века и советской графики.
¶Источники
- Гудфеллоу Я. и др. Generative Adversarial Networks (2014)
- Ho J., Jain A., Abbeel P. Denoising Diffusion Probabilistic Models (2020)
- Материалы разработчиков Stable Diffusion, Midjourney, Kandinsky
- Правовые обзоры по искам художников к разработчикам ИИ-моделей