Открыть сервисСервис

Нейросети, создающие изображения

Нейросеть, создающая изображения — это программа на основе искусственного нейронного сети, обученная генерировать изображения по текстовому описанию, эскизу, фотографии или другому входному сигналу. Такие системы относятся к классу генеративных моделей глубокого обучения и используются в дизайне, рекламе, кинематографии, науке и развлечениях.

Основные архитектуры

Генеративно-состязательные сети

Первой массовой архитектурой для генерации изображений стали GAN (Generative Adversarial Networks), предложенные Яном Гудфеллоу в 2014 году. Сеть состоит из двух конкурирующих моделей: генератора, создающего изображения, и дискриминатора, оценивающего их реалистичность. В ходе обучения генератор учится обманывать дискриминатора, а дискриминатор — распознавать подделки. К GAN-моделям относятся StyleGAN (NVIDIA, 2018–2019), BigGAN и Progressive GAN.

Диффузионные модели

С 2020-х годов доминирующей архитектурой стали диффузионные модели (diffusion models). Их принцип заключается в двух этапах: на первом изображение постепенно «зашумляется» до случайного шума, на втором модель учится обратному процессу — восстанавливать изображение из шума. Ключевые работы — Denoising Diffusion Probabilistic Models (2020) и Latent Diffusion Models (2022), предложенные немецкими исследователями из Heidelberg University и LMU Munich. Именно на базе латентных диффузионных моделей построена система Stable Diffusion, открытая в августе 2022 года.

Авторегрессионные и трансформерные модели

Отдельный подход — трансформерные модели, разбивающие изображение на токены (части) и предсказывающие их последовательно, подобно тому как языковые модели предсказывают слова. Пример — DALL-E (OpenAI, 2021) и его продолжение DALL-E 2 (2022), а также Parti (Google, 2022).

Ключевые системы

СистемаРазработчикГодОсобенности
DALL-EOpenAI2021Трансформерная генерация по тексту
MidjourneyMidjourney, Inc.2022Акцент на художественную стилизацию
Stable DiffusionStability AI, CompVis2022Открытые веса, работа на потребительском железе
DALL-E 3OpenAI2023Интеграция с ChatGPT
FluxBlack Forest Labs2024Высокая детализация, открытая версия

В России разработкой генеративных моделей изображений занимаются, в частности, Сбер (нейросеть Kandinsky, запущенная в 2022 году) и Яндекс (модель Aurora, представленная в 2024 году). Kandinsky работает на основе латентной диффузионной архитектуры и поддерживает русскоязычные описания.

Как обучается модель

Обучение генеративной модели изображений требует больших вычислительных ресурсов и больших датасетов. Типичный набор данных — LAION-5B, открытый индекс из более чем 5 миллиардов пар «изображение — текст», собранный из интернета. Обучение выполняется на графических процессорах (GPU) или тензорных ускорителях (TPU) и занимает от нескольких дней до недель.

Процесс генерации (инференс) для диффузионных моделей состоит из нескольких десятков итераций «шагов диффузии», на каждом из которых модель уточняет изображение. Ускорение инференса — одна из активных областей исследований: например, методы дистилляции и диффузии с малым числом шагов (LCM, SDXL Turbo) сокращают время генерации до секунд.

Применение

  • Дизайн и реклама — создание иллюстраций, макетов, визуализаций продуктов.
  • Кинематограф и игры — генерация концепт-артов, текстур, раскадровок.
  • Медицина — синтез изображений для обучения диагностических моделей, генерация редких патологий.
  • Наука — моделирование молекул, кристаллов, астрономических наблюдений.
  • Личное творчество — создание изображений пользователями без навыков рисования.

Правовые и этические вопросы

Генеративные модели изображений вызывают дискуссии о правах на обучение: художники и фотографы указывают, что модели обучаются на их работах без согласия и вознаграждения. В 2023 году в США поданы коллективные иски к Stability AI, Midjourney и DeviantArt. В ЕС в рамках AI Act генеративные системы обязаны раскрывать факт синтетического происхождения контента. В России с 2024 года действует обязательная маркировка ИИ-сгенерированного контента.

Отдельную проблему представляет дипфейк — подмена лиц на видео и фотографиях с помощью генеративных моделей, что используется для мошенничества и дезинформации.

См. также

  • Искусственный интеллект
  • Глубокое обучение
  • Генеративный дизайн

Источники

  • Goodfellow I. et al. Generative Adversarial Nets. NeurIPS, 2014.
  • Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR, 2022.
  • OpenAI. DALL·E: Creating Images from Text. 2021.
  • LAION-5B dataset documentation. 2022.
  • Kandinsky 3 technical report. Sber AI. 2023.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru