Нейросеть для генерации изображений¶
Нейросеть для генерации картинки — это программа на основе искусственного нейронного сети, обученная создавать изображения по текстовому описанию (промпту) или другому входному сигналу. К подобным системам относятся генеративные модели, построенные на архитектурах трансформеров и диффузионных моделей, — в частности, DALL-E, Midjourney, Stable Diffusion, Kandinsky, «Шедеврум» и другие. Технология применяется в дизайне, рекламе, медицине, образовании и разработке игр, а также вызывает дискуссии о правах на интеллектуальную собственность и достоверности изображений.
¶Принцип работы
Генеративные модели изображений строят картинку «с нуля», а не ищут её в базе данных. Обучение происходит на огромных наборах изображений с подписями — обычно сотнях миллионов пар «фотография + текстовое описание». Модель учится связывать слова и их комбинации с визуальными признаками: объектами, цветами, композицией, стилем.
Наибольшее распространение получили два подхода:
- Диффузионные модели. Обучение строится на постепенном зашумлении изображения и обратном процессе его восстановления. На этапе генерации модель начинает со случайного шума и шаг за шагом «вытаскивает» из него картинку, соответствующую текстовому описанию. Так работают Stable Diffusion, DALL-E 2/3, Midjourney, Kandinsky.
- Генеративные состязательные сети (GAN). Две нейросети — генератор и дискриминатор — соревнуются друг с другом: первая создаёт изображения, вторая оценивает их реалистичность. GAN-модели (например, StyleGAN) широко применяются для генерации лиц и стилизации.
Текстовая часть системы обычно основана на мультимодальных трансформерах, которые преобразуют промпт в числовое представление, понятное генеративной модели.
¶Ключевые архитектуры
¶Stable Diffusion
Открытая диффузионная модель, разработанная компанией Stability AI совместно с исследователями из LMU Munich и Runway. Доступна свободно, может работать на потребительских видеокартах благодаря латентному пространству (модель обучается не на пикселях, а на сжатом представлении изображения). Стала основой для множества сторонних инструментов и сообщества моделей.
¶DALL-E
Серия моделей OpenAI: DALL-E (2021), DALL-E 2 (2022), DALL-E 3 (2023). DALL-E 2 построен на архитектуре CLIP и диффузионной модели, DALL-E 3 — на улучшенном трансформере. Интегрирован в ChatGPT.
¶Midjourney
Коммерческий сервис, известный высокой художественной выразительностью результатов. Изначально работал через интерфейс Discord, позднее получил веб-интерфейс. Модель закрыта, веса не опубликованы.
¶Kandinsky
Российская генеративная модель, разработанная компанией «Сбер» (Сбер AI). Открытая, с русскоязычным интерфейсом и поддержкой русских промптов. Версии Kandinsky 2.1, 2.2 и 3.0 опубликованы под свободными лицензиями.
¶«Шедеврум»
Сервис генерации изображений от «Яндекса», работающий на базе собственной диффузионной модели. Доступен пользователям без специальных технических навыков, интегрирован в продукты компании.
¶Применение
- Дизайн и реклама. Быстрое создание иллюстраций, макетов, визуализаций идей.
- Игры и кино. Генерация концепт-артов, текстур, персонажей, раскадровок.
- Медицина. Синтез медицинских изображений для обучения моделей диагностики, аугментация наборов данных.
- Образование. Создание наглядных материалов, иллюстраций к учебным текстам.
- Наука. Моделирование молекул, кристаллов, астрономических наблюдений (например, модели на основе диффузии для предсказания структуры белков).
¶Этические и правовые вопросы
Генеративные модели обучаются на данных, собранных из интернета, что порождает споры о нарушении авторских прав: художники указывают, что их работы использовались без согласия. В ряде стран идут судебные процессы по этому поводу.
Другая проблема — дипфейки и дезинформация: синтезированные изображения могут имитировать реальных людей и события. В России действует закон, обязывающий маркировать сгенерированные ИИ изображения и видео особым цифровым знаком.
Отдельный вопрос — предвзятость моделей: если обучающие данные содержат стереотипы, модель воспроизводит их в результатах.
Источники:
- Goodfellow I. et al. Generative Adversarial Networks // Advances in Neural Information Processing Systems, 2014.
- Ho J., Jain A., Abbeel P. Denoising Diffusion Probabilistic Models // NeurIPS, 2020.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models // CVPR, 2022.
- Radford A. et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP) // ICML, 2021.
- Сайты Stability AI, OpenAI, Midjourney, «Сбер» (Kandinsky), «Яндекс» («Шедеврум»).