Открыть сервисСервис

Изображения, созданные нейросетью

Изображения, созданные нейросетью — графические произведения, генерируемые программными системами с искусственным интеллектом на основе текстового описания (промпта), эскиза или исходного изображения. К этой категории относятся работы, созданные генеративными моделями глубокого обучения — генеративными состязательными сетями (GAN), диффузионными моделями и трансформерными архитектурами. С 2022 года подобные изображения получили массовое распространение и стали предметом дискуссий о авторстве, авторских правах и качестве.

История

Ранние работы

Первые эксперименты с автоматической генерацией изображений относятся к 2014 году, когда были опубликованы работы по генеративным состязательным сетям (Ian Goodfellow и коллеги). GAN состояли из двух конкурирующих нейросетей — генератора и дискриминатора, — что позволяло создавать всё более реалистичные изображения. В 2015 году Google опубликовал проект DeepDream, в котором свёрточные нейросети использовались для создания фантастических, «сновидческих» изображений на основе уже существующих фотографий.

Взрывной рост (2022)

Ключевым стал 2022 год: в июне вышла DALL-E 2 (OpenAI), в августе — Stable Diffusion (Stability AI, разработан при участии Runway и лабораторий LMU Munich и Heidelberg), в сентябре — Midjourney. Эти системы позволили создавать качественные изображения по текстовому описанию на обычном потребительском оборудовании (Stable Diffusion распространялся с открытыми весами). В декабре 2022 года OpenAI выпустил DALL-E 3, а в 2023 году появились Imagen и Parti от Google, а также Flux от Black Forest Labs.

Технологии

Генеративные состязательные сети (GAN)

GAN состоят из генератора, создающего изображения, и дискриминатора, оценивающего их реалистичность. Обучение ведётся в конкурентном режиме. GAN применялись в моделях StyleGAN (NVIDIA, 2018–2019), создававших реалистичные портреты несуществующих людей.

Диффузионные модели

Основная технология современных генераторов. Модель обучается «размывать» изображение до шума, а затем учиться обратному процессу — восстанавливать изображение из шума. Текстовое описание направляет процесс через механизм cross-attention. Именно на диффузионных моделях построены Stable Diffusion, DALL-E 2/3, Midjourney, Imagen.

Трансформеры и латентные пространства

Stable Diffusion работает не с пикселями напрямую, а с латентным представлением изображения (LDM — Latent Diffusion Model), что резко снижает вычислительные затраты. Текстовые описания кодируются отдельной моделью (CLIP от OpenAI или её аналогами).

Методы генерации

Применение

Генеративные изображения используются в иллюстрациях, рекламе, дизайне, кинематографе (раскадровка, концепт-арт), компьютерных играх, моде, медицине (генерация синтетических данных для обучения диагностических моделей) и науке (визуализация молекул, астрономические изображения). В России генеративные инструменты интегрируются в сервисы Яндекса (нейросеть «Шедеврум» для генерации изображений, 2023) и других компаний.

Авторские права и правовой статус

Правовой статус генеративных изображений остаётся дискуссионным. В США Управление по патентам и товарным знакам (USPTO) и суды неоднократно указывали, что произведения, созданные без человеческого вмешательства, не могут быть защищены авторским правом (дело Zarya of the Dawn, 2023). В России практика по данному вопросу только формируется; в 2023 году Минцифры России рассматривало вопросы правового регулирования генеративного ИИ. Многие генеративные модели обучены на корпусах изображений, собранных из интернета, что вызывает споры о нарушении авторских прав художников и фотографов.

Критика

К основным претензиям относятся: обучение моделей на чужих работах без согласия авторов; риск распространения дезинформации и deepfake; снижение доходов иллюстраторов и фотографов; экологические затраты на обучение моделей. В 2023 году художники подали коллективные иски против Stability AI, Midjourney и DeviantArt (дело仍在 разбирательстве). Одновременно отмечаются случаи мошенничества с использованием генеративных изображений, например, в финансовых схемах.

См. также

  • Генеративно-состязательная нейросеть
  • Диффузионная модель
  • Deepfake
  • CLIP (модель)

Источники

  • Goodfellow I. et al. Generative Adversarial Nets // NeurIPS, 2014.
  • Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models // CVPR, 2022.
  • Ramesh A. et al. Hierarchical Text-Conditional Image Generation with CLIP Latents // arXiv, 2022.
  • Saharia C. et al. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding // NeurIPS, 2022.
  • Материалы прессы о выходе DALL-E 2, Stable Diffusion и Midjourney (2022).
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru