Генеративное изображение с помощью ИИ¶
Генеративное изображение с помощью ИИ — это создание изображений нейронными сетями по текстовому описанию (промпту) или другому входному сигналу. Технология относится к классу генеративных моделей глубокого обучения и получила массовое распространение с 2022 года, когда вышли публичные сервисы вроде DALL-E 2, Stable Diffusion и Midjourney.
¶Принцип работы
Большинство современных систем генерации изображений построены на архитектуре диффузионных моделей. Обучение состоит из двух этапов:
- Прямой процесс — к реальному изображению постепенно добавляется гауссов шум, пока картинка не превратится в случайный шум.
- Обратный процесс — модель учится удалять шум шаг за шагом, восстанавливая изображение.
Текстовое описание кодируется отдельным текстовым энкодером (чаще всего на основе трансформера CLIP), и его векторное представление направляет процесс генерации. В результате модель «вытаскивает» из случайного шума картинку, соответствующую описанию.
Ключевые компоненты системы:
- Текстовый энкодер — превращает промпт в числовые векторы.
- Диффузионная модель — генерирует изображение, удаляя шум.
- Декодер VAE — переводит латентное представление в пиксели.
¶Основные модели и сервисы
| Модель | Разработчик | Год выхода | Особенности |
|---|---|---|---|
| DALL-E 2 / 3 | OpenAI | 2022 / 2023 | Интеграция с ChatGPT, высокое качество текста на картинках |
| Stable Diffusion | Stability AI | 2022 | Открытые веса, работает локально на потребительских GPU |
| Midjourney | Midjourney Inc. | 2022 | Художественная стилизация, доступ через Discord |
| Kandinsky | Сбер | 2022 | Русскоязычная модель, открытые веса |
| Шедеврум | Яндекс | 2023 | Сервис на базе собственной диффузионной модели |
В России разработаны и другие системы: у Яндекса есть диффузионная модель, интегрированная в поиск и редактор фото; Сбер выпустил серию моделей Kandinsky, поддерживающих русский язык промптов без внешнего перевода.
¶Способы управления генерацией
Помимо текстового описания, результат можно корректировать дополнительными приёмами:
- Негативный промпт — перечисление того, что не должно попасть на картинку («размытость, лишние пальцы, низкое качество»).
- ControlNet — дополнение к Stable Diffusion, позволяющее задать позу человека, контуры сцены или карту глубины.
- Img2img — генерация на основе существующего изображения с заданной силой преобразования.
- Inpainting — перерисовка отдельной области картинки с сохранением остальной части.
- Seed — фиксация случайного числа для воспроизводимого результата.
¶Применение
Генеративные изображения используются в иллюстрации, рекламе, дизайне, геймдеве (создание концептов и текстур), кинематографе (раскадровка, превизуализация) и образовании. В России технологии применяются в медиа, маркетинге и образовательных проектах; крупные компании встраивают генерацию в свои продукты — например, Яндекс добавил функцию создания изображений в поисковую выдачу и редактор.
¶Ограничения и этические вопросы
Текущие модели склонны к ошибкам в анатомии (лишние пальцы, искажённые уши), плохо воспроизводят точный текст на изображении и иногда «галлюцинируют» детали. Обучение происходит на больших датасетах, собранных из интернета, что вызывает споры о правах авторов изображений. Отдельную проблему представляет генерация дипфейков — подделок с лицами реальных людей, что привело к правовым ограничениям в ряде стран.
¶История
До диффузионных моделей использовались GAN (генеративно-состязательные сети), показавшие первые убедительные результаты генерации лиц (проект This Person Does Not Exist, 2019). В 2021 году OpenAI представила DALL-E, работавшую на трансформерной архитектуре, а в 2022 году диффузионные модели вытеснили GAN благодаря открытому релизу Stable Diffusion и высокому качеству Midjourney.