Открыть сервисСервис

Генеративные ИИ-модели для создания изображений

Генеративные ИИ-модели для создания изображений — это класс программных систем искусственного интеллекта, способных генерировать изображения по текстовому описанию (промпту), рисунку или другому входному сигналу. Ключевой технологией является диффузионная модель, обученная на больших массивах графических данных; в России подобные системы разрабатывают в ряде исследовательских центров и технологических компаний.

Принцип работы

Генерация изображения по описанию строится на нескольких последовательных этапах:

  1. Текстовый энкодер преобразует пользовательскую строку (промпт) в числовое представление — вектор признаков. Для этого используются языковые модели, обученные на парах «текст — изображение».
  2. Диффузионная модель строит изображение, последовательно удаляя «шум» из случайного шумового поля под управлением текстового условия. Вместо прямого предсказания пикселей модель обучается обратному процессу — восстановлению чистого изображения из зашумлённого.
  3. Декодер (чаще всего вариационный автоэнкодер, VAE) переводит латентное представление в растровое изображение.

Альтернативный подход — генеративно-состязательные сети (GAN), в которых генератор и дискриминатор конкурируют друг с другом; в 2020-е годы диффузионные модели вытеснили GAN в большинстве публичных систем генерации изображений.

История развития

Первые значимые результаты в генерации изображений нейросетями получены в середине 2010-х годов на основе GAN, предложенных Яном Гудфеллоу в 2014 году. В 2021 году OpenAI представила DALL-E, а в 2022-м — DALL-E 2, продемонстрировавшие высокое качество генерации по текстовым описаниям. В том же 2022 году вышли Stable Diffusion (от Stability AI, разработанная при участии немецких исследователей) и Midjourney, ставшие доступными широкой аудитории.

В России работы по генеративным моделям ведутся в академических и корпоративных лабораториях. Среди известных отечественных разработок — нейросети «Сбер», «Яндекса» и ряда стартапов, в том числе системы, работающие с русскоязычными описаниями и учитывающие специфику кириллицы.

Классификация систем

Тип моделиОсобенностиПримеры
ДиффузионныеВысокое качество, медленная генерацияStable Diffusion, DALL-E, Midjourney
GANБыстрая генерация, ограниченное разнообразиеStyleGAN, VQGAN+CLIP
Трансформерные (autoregressive)Последовательная генерация токеновParti, VAR
ГибридныеКомбинация подходовImagen, Kandinsky

Применение

Генеративные модели изображений применяются в дизайне и рекламе (создание макетов, иллюстраций, продуктовых снимков), в кинематографии и игростроении (концепт-арт, текстуры, превью сцен), в образовании (визуализация сложных понятий), в медицине (генерация синтетических данных для обучения диагностических моделей), а также в личном творчестве.

Правовые и этические вопросы

Генерация изображений вызывает споры вокруг авторских прав: модели обучены на миллионах картинок, созданных художниками, и результат может воспроизводить узнаваемый стиль конкретного автора. В ряде юрисдикций идут судебные процессы по этому поводу. Отдельная проблема — дипфейки, то есть поддельные изображения реальных людей, используемые для дезинформации и мошенничества; в России за распространение заведомо ложной информации и дипфейков предусмотрена административная и уголовная ответственность.

Промпт-инжиниринг

Качество результата существенно зависит от формулировки описания. Пользователи применяют техники промпт-инжиниринга: указание стиля («акварель», «кинематографический кадр»), композиции, освещения, художественного направления, а также негативных промптов — того, что не должно появиться в изображении. Существуют библиотеки готовых промптов и сообщества, где пользователи делятся рабочими описаниями.

Источники:

  • Goodfellow I. et al. Generative Adversarial Networks. — NeurIPS, 2014.
  • Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. — CVPR, 2022.
  • Ramesh A. et al. Zero-Shot Text-to-Image Generation. — ICML, 2021.
  • Saharia C. et al. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. — NeurIPS, 2022.
  • Encyclopædia Britannica: «Generative adversarial network», «Diffusion model».
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru