Нейросети, создающие изображения¶
Нейросеть, создающая изображения — это программа на основе искусственного нейронного сети, обученная генерировать изображения по текстовому описанию, эскизу, фотографии или другому входному сигналу. Такие системы относятся к классу генеративных моделей глубокого обучения и используются в дизайне, рекламе, кинематографии, науке и развлечениях.
¶Основные архитектуры
¶Генеративно-состязательные сети
Первой массовой архитектурой для генерации изображений стали GAN (Generative Adversarial Networks), предложенные Яном Гудфеллоу в 2014 году. Сеть состоит из двух конкурирующих моделей: генератора, создающего изображения, и дискриминатора, оценивающего их реалистичность. В ходе обучения генератор учится обманывать дискриминатора, а дискриминатор — распознавать подделки. К GAN-моделям относятся StyleGAN (NVIDIA, 2018–2019), BigGAN и Progressive GAN.
¶Диффузионные модели
С 2020-х годов доминирующей архитектурой стали диффузионные модели (diffusion models). Их принцип заключается в двух этапах: на первом изображение постепенно «зашумляется» до случайного шума, на втором модель учится обратному процессу — восстанавливать изображение из шума. Ключевые работы — Denoising Diffusion Probabilistic Models (2020) и Latent Diffusion Models (2022), предложенные немецкими исследователями из Heidelberg University и LMU Munich. Именно на базе латентных диффузионных моделей построена система Stable Diffusion, открытая в августе 2022 года.
¶Авторегрессионные и трансформерные модели
Отдельный подход — трансформерные модели, разбивающие изображение на токены (части) и предсказывающие их последовательно, подобно тому как языковые модели предсказывают слова. Пример — DALL-E (OpenAI, 2021) и его продолжение DALL-E 2 (2022), а также Parti (Google, 2022).
¶Ключевые системы
| Система | Разработчик | Год | Особенности |
|---|---|---|---|
| DALL-E | OpenAI | 2021 | Трансформерная генерация по тексту |
| Midjourney | Midjourney, Inc. | 2022 | Акцент на художественную стилизацию |
| Stable Diffusion | Stability AI, CompVis | 2022 | Открытые веса, работа на потребительском железе |
| DALL-E 3 | OpenAI | 2023 | Интеграция с ChatGPT |
| Flux | Black Forest Labs | 2024 | Высокая детализация, открытая версия |
В России разработкой генеративных моделей изображений занимаются, в частности, Сбер (нейросеть Kandinsky, запущенная в 2022 году) и Яндекс (модель Aurora, представленная в 2024 году). Kandinsky работает на основе латентной диффузионной архитектуры и поддерживает русскоязычные описания.
¶Как обучается модель
Обучение генеративной модели изображений требует больших вычислительных ресурсов и больших датасетов. Типичный набор данных — LAION-5B, открытый индекс из более чем 5 миллиардов пар «изображение — текст», собранный из интернета. Обучение выполняется на графических процессорах (GPU) или тензорных ускорителях (TPU) и занимает от нескольких дней до недель.
Процесс генерации (инференс) для диффузионных моделей состоит из нескольких десятков итераций «шагов диффузии», на каждом из которых модель уточняет изображение. Ускорение инференса — одна из активных областей исследований: например, методы дистилляции и диффузии с малым числом шагов (LCM, SDXL Turbo) сокращают время генерации до секунд.
¶Применение
- Дизайн и реклама — создание иллюстраций, макетов, визуализаций продуктов.
- Кинематограф и игры — генерация концепт-артов, текстур, раскадровок.
- Медицина — синтез изображений для обучения диагностических моделей, генерация редких патологий.
- Наука — моделирование молекул, кристаллов, астрономических наблюдений.
- Личное творчество — создание изображений пользователями без навыков рисования.
¶Правовые и этические вопросы
Генеративные модели изображений вызывают дискуссии о правах на обучение: художники и фотографы указывают, что модели обучаются на их работах без согласия и вознаграждения. В 2023 году в США поданы коллективные иски к Stability AI, Midjourney и DeviantArt. В ЕС в рамках AI Act генеративные системы обязаны раскрывать факт синтетического происхождения контента. В России с 2024 года действует обязательная маркировка ИИ-сгенерированного контента.
Отдельную проблему представляет дипфейк — подмена лиц на видео и фотографиях с помощью генеративных моделей, что используется для мошенничества и дезинформации.
¶См. также
- Искусственный интеллект
- Глубокое обучение
- Генеративный дизайн
¶Источники
- Goodfellow I. et al. Generative Adversarial Nets. NeurIPS, 2014.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR, 2022.
- OpenAI. DALL·E: Creating Images from Text. 2021.
- LAION-5B dataset documentation. 2022.
- Kandinsky 3 technical report. Sber AI. 2023.