Изображения, созданные нейросетью¶
Изображения, созданные нейросетью — графические произведения, генерируемые программными системами с искусственным интеллектом на основе текстового описания (промпта), эскиза или исходного изображения. К этой категории относятся работы, созданные генеративными моделями глубокого обучения — генеративными состязательными сетями (GAN), диффузионными моделями и трансформерными архитектурами. С 2022 года подобные изображения получили массовое распространение и стали предметом дискуссий о авторстве, авторских правах и качестве.
¶История
¶Ранние работы
Первые эксперименты с автоматической генерацией изображений относятся к 2014 году, когда были опубликованы работы по генеративным состязательным сетям (Ian Goodfellow и коллеги). GAN состояли из двух конкурирующих нейросетей — генератора и дискриминатора, — что позволяло создавать всё более реалистичные изображения. В 2015 году Google опубликовал проект DeepDream, в котором свёрточные нейросети использовались для создания фантастических, «сновидческих» изображений на основе уже существующих фотографий.
¶Взрывной рост (2022)
Ключевым стал 2022 год: в июне вышла DALL-E 2 (OpenAI), в августе — Stable Diffusion (Stability AI, разработан при участии Runway и лабораторий LMU Munich и Heidelberg), в сентябре — Midjourney. Эти системы позволили создавать качественные изображения по текстовому описанию на обычном потребительском оборудовании (Stable Diffusion распространялся с открытыми весами). В декабре 2022 года OpenAI выпустил DALL-E 3, а в 2023 году появились Imagen и Parti от Google, а также Flux от Black Forest Labs.
¶Технологии
¶Генеративные состязательные сети (GAN)
GAN состоят из генератора, создающего изображения, и дискриминатора, оценивающего их реалистичность. Обучение ведётся в конкурентном режиме. GAN применялись в моделях StyleGAN (NVIDIA, 2018–2019), создававших реалистичные портреты несуществующих людей.
¶Диффузионные модели
Основная технология современных генераторов. Модель обучается «размывать» изображение до шума, а затем учиться обратному процессу — восстанавливать изображение из шума. Текстовое описание направляет процесс через механизм cross-attention. Именно на диффузионных моделях построены Stable Diffusion, DALL-E 2/3, Midjourney, Imagen.
¶Трансформеры и латентные пространства
Stable Diffusion работает не с пикселями напрямую, а с латентным представлением изображения (LDM — Latent Diffusion Model), что резко снижает вычислительные затраты. Текстовые описания кодируются отдельной моделью (CLIP от OpenAI или её аналогами).
¶Методы генерации
- Текстовое описание (text-to-image) — основной способ: пользователь задаёт промпт на естественном языке.
- Image-to-image — генерация на основе исходного изображения (стилизация, дорисовка).
- Inpainting — дорисовка отдельных участков изображения.
- Upscaling — увеличение разрешения с детализацией.
- ControlNet — управление композицией через эскиз, карту глубины или позу.
¶Применение
Генеративные изображения используются в иллюстрациях, рекламе, дизайне, кинематографе (раскадровка, концепт-арт), компьютерных играх, моде, медицине (генерация синтетических данных для обучения диагностических моделей) и науке (визуализация молекул, астрономические изображения). В России генеративные инструменты интегрируются в сервисы Яндекса (нейросеть «Шедеврум» для генерации изображений, 2023) и других компаний.
¶Авторские права и правовой статус
Правовой статус генеративных изображений остаётся дискуссионным. В США Управление по патентам и товарным знакам (USPTO) и суды неоднократно указывали, что произведения, созданные без человеческого вмешательства, не могут быть защищены авторским правом (дело Zarya of the Dawn, 2023). В России практика по данному вопросу только формируется; в 2023 году Минцифры России рассматривало вопросы правового регулирования генеративного ИИ. Многие генеративные модели обучены на корпусах изображений, собранных из интернета, что вызывает споры о нарушении авторских прав художников и фотографов.
¶Критика
К основным претензиям относятся: обучение моделей на чужих работах без согласия авторов; риск распространения дезинформации и deepfake; снижение доходов иллюстраторов и фотографов; экологические затраты на обучение моделей. В 2023 году художники подали коллективные иски против Stability AI, Midjourney и DeviantArt (дело仍在 разбирательстве). Одновременно отмечаются случаи мошенничества с использованием генеративных изображений, например, в финансовых схемах.
¶См. также
- Генеративно-состязательная нейросеть
- Диффузионная модель
- Deepfake
- CLIP (модель)
¶Источники
- Goodfellow I. et al. Generative Adversarial Nets // NeurIPS, 2014.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models // CVPR, 2022.
- Ramesh A. et al. Hierarchical Text-Conditional Image Generation with CLIP Latents // arXiv, 2022.
- Saharia C. et al. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding // NeurIPS, 2022.
- Материалы прессы о выходе DALL-E 2, Stable Diffusion и Midjourney (2022).