Открыть сервис

Диффузионные нейросети

Диффузионные нейросети (диффузионные модели) — это класс генеративных вероятностных моделей машинного обучения, которые обучаются восстанавливать данные из зашумлённого состояния, постепенно удаляя искусственно добавленный шум. Основное применение диффузионных нейросетей — генерация изображений, аудио, видео и трёхмерных моделей высокого качества по текстовому описанию или другим условиям. В отличие от генеративно-состязательных сетей (GAN), диффузионные модели отличаются большей стабильностью обучения и способностью генерировать более разнообразные и детализированные результаты, хотя требуют больше вычислительных ресурсов на этапе инференса.

История

Предпосылки и первые работы

Идея использования процессов диффузии для генерации данных восходит к работам по неравновесной термодинамике и статистической физике. В 2015 году исследователи из Стэнфордского университета и Калифорнийского университета в Беркли предложили концепцию «глубоких генеративных моделей с использованием марковских цепей» (Deep Unsupervised Learning using Nonequilibrium Thermodynamics), которая заложила теоретическую основу для диффузионных моделей. Однако практическая реализация была ограничена из-за высокой вычислительной сложности.

Прорыв в 2020 году

Ключевой прорыв произошёл в 2020 году, когда группа исследователей из Калифорнийского университета в Беркли (Джонатан Хо, Аджай Джайн, Питер Аббил) опубликовала работу «Denoising Diffusion Probabilistic Models» (DDPM). В ней был предложен эффективный алгоритм обучения, основанный на предсказании шума, добавленного на каждом шаге прямого процесса. DDPM показали качество генерации, сравнимое с лучшими GAN-моделями того времени, на наборе данных CIFAR-10.

Развитие и масштабирование

В 2021–2022 годах диффузионные модели начали активно развиваться. Появились модификации, такие как:

  • Score-based generative models (Ян Сонг, 2020–2021), которые обобщили подход DDPM на непрерывные временные шаги.
  • Latent Diffusion Models (LDM), предложенные группой из Мюнхенского университета (Робин Ромбах и др.) в 2022 году. LDM выполняют диффузию в сжатом латентном пространстве, что значительно снижает вычислительные затраты. Эта архитектура легла в основу Stable Diffusion.
  • Classifier-Free Guidance (CFG), метод, позволяющий управлять генерацией без использования отдельного классификатора, что повысило качество и разнообразие результатов.

Современное состояние

Начиная с 2022 года диффузионные модели стали доминирующим подходом в генерации изображений. Они используются в таких продуктах, как DALL-E 3 (OpenAI), Midjourney, Stable Diffusion (Stability AI), Imagen (Google). В 2023–2024 годах модели были адаптированы для генерации видео (Sora от OpenAI, Stable Video Diffusion), аудио (AudioLDM, MusicGen) и трёхмерных объектов (Point-E, DreamFusion). В России разработкой диффузионных моделей занимаются компании «Яндекс» (модель YandexART) и «Сбер» (модель Kandinsky).

Принцип работы

Прямой процесс (диффузия)

Прямой процесс (forward diffusion) — это постепенное добавление гауссовского шума к исходным данным (например, к изображению). На каждом шаге \( t \) к данным \( x_{t-1} \) добавляется шум \( \epsilon \), взятый из нормального распределения \( \mathcal{N}(0, \mathbf{I}) \), с коэффициентом, зависящим от расписания шума (noise schedule). Через \( T \) шагов (обычно 1000) данные превращаются в чистый гауссовский шум, не содержащий информации об исходном образце. Прямой процесс является марковским — состояние на шаге \( t \) зависит только от состояния на шаге \( t-1 \).

Обратный процесс (денойзинг)

Обратный процесс (reverse diffusion) — это обучение нейросети (обычно U-Net или Transformer) предсказывать добавленный шум на каждом шаге. Модель принимает зашумлённые данные \( x_t \) и номер шага \( t \), а на выходе выдаёт оценку шума \( \epsilon_\theta(x_t, t) \). Вычитая предсказанный шум, модель получает менее зашумлённую версию \( x_{t-1} \). Повторяя эту операцию от \( t=T \) до \( t=0 \), можно восстановить чистые данные из случайного шума.

Функция потерь

Обучение диффузионной модели сводится к минимизации среднеквадратичной ошибки (MSE) между предсказанным и истинным шумом: \[ L = \mathbb{E}_{t, x_0, \epsilon} \left[ \| \epsilon - \epsilon_\theta(x_t, t) \|^2 \right] \] где \( x_0 \) — исходные данные, \( \epsilon \) — добавленный шум, \( t \) — случайный шаг, равномерно выбранный из \( [1, T] \).

Классификация

По типу данных

  • Изображения: наиболее распространённый тип. Модели генерируют растровые изображения (RGB) по текстовому описанию, по частичному изображению (inpainting/outpainting) или по изображению-стилю.
  • Аудио: генерация музыки, звуковых эффектов, речи. Примеры: AudioLDM, MusicGen (Meta).
  • Видео: генерация коротких видеороликов, анимации. Примеры: Sora (OpenAI), Stable Video Diffusion.
  • Трёхмерные модели: генерация облаков точек, мешей, вокселей. Примеры: Point-E, DreamFusion.

По архитектуре

  • DDPM (Denoising Diffusion Probabilistic Models): классическая архитектура с U-Net и временным кодированием.
  • Latent Diffusion Models (LDM): диффузия в латентном пространстве, сжатом автоэнкодером (VAE). Это позволяет работать с большими изображениями (512×512 и выше) на обычных видеокартах.
  • Score-based models: используют оценку градиента логарифма плотности данных (score function) и решают стохастические дифференциальные уравнения (SDE).
  • Transformer-based: замена U-Net на архитектуру Transformer (например, DiT — Diffusion Transformer), что улучшает масштабируемость.

По способу управления

  • Безусловные (unconditional): генерируют данные без дополнительных условий, только на основе шума.
  • Условные (conditional): принимают дополнительный вход (текст, изображение, класс, аудио). Условие подаётся через механизмы кросс-внимания (cross-attention) или встраивание (embedding).
  • С управляющим сигналом (guidance): используют Classifier-Free Guidance (CFG) для усиления влияния условия, что повышает качество, но снижает разнообразие.

Применение

Генерация изображений

Диффузионные модели стали основой для большинства современных генераторов изображений. Пользователь вводит текстовое описание (prompt), и модель создаёт изображение, соответствующее описанию. Применяется в дизайне, рекламе, иллюстрировании, концепт-арте, а также в научной визуализации. В России такие модели используются в сервисах «Шедеврум» (Яндекс) и «Kandinsky» (Сбер).

Редактирование и ретушь

Модели позволяют изменять существующие изображения: заменять объекты, менять фон, дорисовывать отсутствующие части (inpainting), расширять границы изображения (outpainting). Это востребовано в фотографии, кинопроизводстве и компьютерных играх.

Генерация видео

Диффузионные модели для видео работают аналогично моделям для изображений, но дополнительно учитывают временную согласованность кадров. Применяются для создания анимации, спецэффектов, рекламных роликов. В 2024 году модель Sora (OpenAI) продемонстрировала возможность генерации видео длительностью до 60 секунд с высоким качеством.

Генерация аудио

Диффузионные модели для аудио генерируют музыку, звуковые эффекты и речь. Они могут создавать новые композиции в заданном стиле, имитировать голоса или очищать аудиозаписи от шумов. Примеры: AudioLDM, MusicGen (Meta — организация признана экстремистской и запрещена в РФ).

Научные исследования

Диффузионные модели применяются в биоинформатике для генерации молекул с заданными свойствами (например, для поиска новых лекарств), в физике — для моделирования сложных процессов, в астрономии — для восстановления изображений с телескопов.

Преимущества и недостатки

Преимущества

  • Высокое качество генерации: диффузионные модели превосходят GAN по реалистичности и детализации на большинстве бенчмарков.
  • Стабильность обучения: в отличие от GAN, диффузионные модели не страдают от коллапса мод и не требуют сложного баланса между генератором и дискриминатором.
  • Гибкость: легко адаптируются под разные типы данных и условия (текст, изображение, аудио).
  • Масштабируемость: увеличение размера модели и объёма обучающих данных приводит к предсказуемому улучшению качества.

Недостатки

  • Высокая вычислительная стоимость: обратный процесс требует последовательного выполнения сотен или тысяч шагов, что замедляет генерацию. Для ускорения используются методы дистилляции (например, Progressive Distillation) и решатели SDE (например, DPM-Solver).
  • Большой объём памяти: модели содержат миллиарды параметров (например, Stable Diffusion 3 — 8 млрд параметров) и требуют видеокарт с большим объёмом VRAM.
  • Трудности с точным контролем: несмотря на CFG, модели могут генерировать нежелательные детали (артефакты, искажения пропорций, неправильные конечности).
  • Этические проблемы: возможность генерации дипфейков, порнографии, насилия и другого нежелательного контента. Для борьбы с этим используются фильтры и модерация.

Интересные факты

  • Первая публичная демонстрация диффузионной модели, способной генерировать изображения по тексту, была проведена компанией OpenAI в 2021 году с моделью DALL-E.
  • Модель Stable Diffusion была выпущена в открытом доступе в 2022 году, что привело к взрывному росту числа приложений и исследований в этой области.
  • В 2023 году диффузионные модели начали использоваться для генерации трёхмерных объектов, что открыло перспективы для автоматизации в игровой индустрии и архитектуре.
  • В России диффузионные модели развиваются в рамках национальных проектов по искусственному интеллекту, в частности, модель Kandinsky 3.0 (Сбер) поддерживает генерацию изображений и видео.

Источники

  • Ho, J., Jain, A., & Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. Advances in Neural Information Processing Systems.
  • Song, Y., & Ermon, S. (2020). Generative Modeling by Estimating Gradients of the Data Distribution. Advances in Neural Information Processing Systems.
  • Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  • Dhariwal, P., & Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. Advances in Neural Information Processing Systems.
  • OpenAI. (2024). Video generation models as world simulators (Sora).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →