Открыть сервисСервис

Генеративные изображения

Генеративные изображения (нейросетевые картинки) — изображения, создаваемые программами на основе искусственного интеллекта по текстовому описанию (промпту), эскизу или другому входному сигналу. К началу 2020-х годов генеративные изображения стали массовым явлением: их используют в дизайне, рекламе, образовании, журналистике и развлечениях, а качество снимков и иллюстраций, созданных нейросетями, на многих задачах приблизилось к фотографическому.

Технологии генерации

Современные системы генерации изображений строятся на архитектурах глубокого обучения. Ключевую роль сыграли генеративно-состязательные сети (GAN), предложенные Яном Гудфеллоу в 2014 году: одна сеть генерирует изображение, вторая — отличает подделку от оригинала, в результате чего качество генерации растёт. Позднее основой стали диффузионные модели — алгоритмы, которые учатся превращать шум в осмысленное изображение за счёт обратимых шагов зашумления и очистки. Именно на диффузионных архитектурах построены публичные системы Midjourney, Stable Diffusion и DALL-E.

Русскоязычный сегмент представлен, в частности, нейросетью Kandinsky (разработка «Сбера»), а также моделями «Яндекса» и других российских компаний. В 2023 году «Сбер» открыл веса Kandinsky под свободной лицензией, что позволило развивать локальные решения без обращения к зарубежным сервисам.

Способы задания изображения

СпособОписание
Текстовое описание (промпт)Пользователь описывает желаемое изображение словами: сюжет, стиль, настроение, освещение
Скетч или эскизНейросеть дорисовывает и детализирует набросок
Изображение-референсГенерация на основе существующей картинки: смена стиля, апскейл, вариации
СегментацияПользователь выделяет области и задаёт отдельные описания для каждой
ИнпейнтингЗаполнение вырезанной части изображения с сохранением окружения

Применение

Генеративные изображения применяются в коммерческом дизайне для быстрого создания иллюстраций, макетов и рекламных материалов. Издательства и образовательные проекты используют их для визуализации абстрактных понятий и исторических сцен, которых нет в фотобанках. В играх и кинематографе нейросети генерируют концепт-арт, текстуры и раскадровки. Российские разработчики применяют генеративные модели в промышленном дизайне, архитектурной визуализации и создании обучающих материалов.

Авторские права и правовой статус

Правовой статус нейросетевых изображений остаётся дискуссионным. В США суды рассматривают иски художников против разработчиков моделей (в частности, против Stability AI и Midjourney) о незаконном использовании обучающих данных. В России вопрос авторских прав на генеративные изображения пока не урегулирован отдельным законодательством: по общему правилу, произведение, созданное без творческого участия человека, не признаётся объектом авторского права. Практика показывает, что нейросетевые картинки активно используются в СМИ и рекламе без единого правового режима.

Этические вопросы

К числу обсуждаемых проблем относятся дезинформация (генерация «фотографий» несуществующих событий), подделка документов и изображений реальных людей, а также вытеснение иллюстраторов и фотографов с рынка. Ряд сервисов добавляет в генерируемые изображения невидимые метаданные C2PA, позволяющие проверить происхождение файла. В России в 2023 году внесены поправки в закон об информации, обязывающие помечать сгенерированные ИИ изображения и видео как таковые при публичном распространении.

Интересные факты

  • В 2022 году сгенерированное нейросетью изображение «Théâtre D'opéra Spatial» получило первую премию на конкурсе искусств штата Колорадо, что вызвало споры о допустимости участия ИИ-работ.
  • Диффузионные модели генерируют изображение за десятки итераций, каждая из которых убирает часть шума.
  • Некоторые российские сервисы предлагают генерацию изображений в стиле русской живописи XIX века и советской графики.

Источники

  • Гудфеллоу Я. и др. Generative Adversarial Networks (2014)
  • Ho J., Jain A., Abbeel P. Denoising Diffusion Probabilistic Models (2020)
  • Материалы разработчиков Stable Diffusion, Midjourney, Kandinsky
  • Правовые обзоры по искам художников к разработчикам ИИ-моделей
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru