Диффузионные нейросети
Диффузионные нейросети (диффузионные модели) — это класс генеративных вероятностных моделей машинного обучения, которые обучаются восстанавливать данные из зашумлённого состояния, постепенно удаляя искусственно добавленный шум. Основное применение диффузионных нейросетей — генерация изображений, аудио, видео и трёхмерных моделей высокого качества по текстовому описанию или другим условиям. В отличие от генеративно-состязательных сетей (GAN), диффузионные модели отличаются большей стабильностью обучения и способностью генерировать более разнообразные и детализированные результаты, хотя требуют больше вычислительных ресурсов на этапе инференса.
История
Предпосылки и первые работы
Идея использования процессов диффузии для генерации данных восходит к работам по неравновесной термодинамике и статистической физике. В 2015 году исследователи из Стэнфордского университета и Калифорнийского университета в Беркли предложили концепцию «глубоких генеративных моделей с использованием марковских цепей» (Deep Unsupervised Learning using Nonequilibrium Thermodynamics), которая заложила теоретическую основу для диффузионных моделей. Однако практическая реализация была ограничена из-за высокой вычислительной сложности.
Прорыв в 2020 году
Ключевой прорыв произошёл в 2020 году, когда группа исследователей из Калифорнийского университета в Беркли (Джонатан Хо, Аджай Джайн, Питер Аббил) опубликовала работу «Denoising Diffusion Probabilistic Models» (DDPM). В ней был предложен эффективный алгоритм обучения, основанный на предсказании шума, добавленного на каждом шаге прямого процесса. DDPM показали качество генерации, сравнимое с лучшими GAN-моделями того времени, на наборе данных CIFAR-10.
Развитие и масштабирование
В 2021–2022 годах диффузионные модели начали активно развиваться. Появились модификации, такие как:
- Score-based generative models (Ян Сонг, 2020–2021), которые обобщили подход DDPM на непрерывные временные шаги.
- Latent Diffusion Models (LDM), предложенные группой из Мюнхенского университета (Робин Ромбах и др.) в 2022 году. LDM выполняют диффузию в сжатом латентном пространстве, что значительно снижает вычислительные затраты. Эта архитектура легла в основу Stable Diffusion.
- Classifier-Free Guidance (CFG), метод, позволяющий управлять генерацией без использования отдельного классификатора, что повысило качество и разнообразие результатов.
Современное состояние
Начиная с 2022 года диффузионные модели стали доминирующим подходом в генерации изображений. Они используются в таких продуктах, как DALL-E 3 (OpenAI), Midjourney, Stable Diffusion (Stability AI), Imagen (Google). В 2023–2024 годах модели были адаптированы для генерации видео (Sora от OpenAI, Stable Video Diffusion), аудио (AudioLDM, MusicGen) и трёхмерных объектов (Point-E, DreamFusion). В России разработкой диффузионных моделей занимаются компании «Яндекс» (модель YandexART) и «Сбер» (модель Kandinsky).
Принцип работы
Прямой процесс (диффузия)
Прямой процесс (forward diffusion) — это постепенное добавление гауссовского шума к исходным данным (например, к изображению). На каждом шаге \( t \) к данным \( x_{t-1} \) добавляется шум \( \epsilon \), взятый из нормального распределения \( \mathcal{N}(0, \mathbf{I}) \), с коэффициентом, зависящим от расписания шума (noise schedule). Через \( T \) шагов (обычно 1000) данные превращаются в чистый гауссовский шум, не содержащий информации об исходном образце. Прямой процесс является марковским — состояние на шаге \( t \) зависит только от состояния на шаге \( t-1 \).
Обратный процесс (денойзинг)
Обратный процесс (reverse diffusion) — это обучение нейросети (обычно U-Net или Transformer) предсказывать добавленный шум на каждом шаге. Модель принимает зашумлённые данные \( x_t \) и номер шага \( t \), а на выходе выдаёт оценку шума \( \epsilon_\theta(x_t, t) \). Вычитая предсказанный шум, модель получает менее зашумлённую версию \( x_{t-1} \). Повторяя эту операцию от \( t=T \) до \( t=0 \), можно восстановить чистые данные из случайного шума.
Функция потерь
Обучение диффузионной модели сводится к минимизации среднеквадратичной ошибки (MSE) между предсказанным и истинным шумом: \[ L = \mathbb{E}_{t, x_0, \epsilon} \left[ \| \epsilon - \epsilon_\theta(x_t, t) \|^2 \right] \] где \( x_0 \) — исходные данные, \( \epsilon \) — добавленный шум, \( t \) — случайный шаг, равномерно выбранный из \( [1, T] \).
Классификация
По типу данных
- Изображения: наиболее распространённый тип. Модели генерируют растровые изображения (RGB) по текстовому описанию, по частичному изображению (inpainting/outpainting) или по изображению-стилю.
- Аудио: генерация музыки, звуковых эффектов, речи. Примеры: AudioLDM, MusicGen (Meta).
- Видео: генерация коротких видеороликов, анимации. Примеры: Sora (OpenAI), Stable Video Diffusion.
- Трёхмерные модели: генерация облаков точек, мешей, вокселей. Примеры: Point-E, DreamFusion.
По архитектуре
- DDPM (Denoising Diffusion Probabilistic Models): классическая архитектура с U-Net и временным кодированием.
- Latent Diffusion Models (LDM): диффузия в латентном пространстве, сжатом автоэнкодером (VAE). Это позволяет работать с большими изображениями (512×512 и выше) на обычных видеокартах.
- Score-based models: используют оценку градиента логарифма плотности данных (score function) и решают стохастические дифференциальные уравнения (SDE).
- Transformer-based: замена U-Net на архитектуру Transformer (например, DiT — Diffusion Transformer), что улучшает масштабируемость.
По способу управления
- Безусловные (unconditional): генерируют данные без дополнительных условий, только на основе шума.
- Условные (conditional): принимают дополнительный вход (текст, изображение, класс, аудио). Условие подаётся через механизмы кросс-внимания (cross-attention) или встраивание (embedding).
- С управляющим сигналом (guidance): используют Classifier-Free Guidance (CFG) для усиления влияния условия, что повышает качество, но снижает разнообразие.
Применение
Генерация изображений
Диффузионные модели стали основой для большинства современных генераторов изображений. Пользователь вводит текстовое описание (prompt), и модель создаёт изображение, соответствующее описанию. Применяется в дизайне, рекламе, иллюстрировании, концепт-арте, а также в научной визуализации. В России такие модели используются в сервисах «Шедеврум» (Яндекс) и «Kandinsky» (Сбер).
Редактирование и ретушь
Модели позволяют изменять существующие изображения: заменять объекты, менять фон, дорисовывать отсутствующие части (inpainting), расширять границы изображения (outpainting). Это востребовано в фотографии, кинопроизводстве и компьютерных играх.
Генерация видео
Диффузионные модели для видео работают аналогично моделям для изображений, но дополнительно учитывают временную согласованность кадров. Применяются для создания анимации, спецэффектов, рекламных роликов. В 2024 году модель Sora (OpenAI) продемонстрировала возможность генерации видео длительностью до 60 секунд с высоким качеством.
Генерация аудио
Диффузионные модели для аудио генерируют музыку, звуковые эффекты и речь. Они могут создавать новые композиции в заданном стиле, имитировать голоса или очищать аудиозаписи от шумов. Примеры: AudioLDM, MusicGen (Meta — организация признана экстремистской и запрещена в РФ).
Научные исследования
Диффузионные модели применяются в биоинформатике для генерации молекул с заданными свойствами (например, для поиска новых лекарств), в физике — для моделирования сложных процессов, в астрономии — для восстановления изображений с телескопов.
Преимущества и недостатки
Преимущества
- Высокое качество генерации: диффузионные модели превосходят GAN по реалистичности и детализации на большинстве бенчмарков.
- Стабильность обучения: в отличие от GAN, диффузионные модели не страдают от коллапса мод и не требуют сложного баланса между генератором и дискриминатором.
- Гибкость: легко адаптируются под разные типы данных и условия (текст, изображение, аудио).
- Масштабируемость: увеличение размера модели и объёма обучающих данных приводит к предсказуемому улучшению качества.
Недостатки
- Высокая вычислительная стоимость: обратный процесс требует последовательного выполнения сотен или тысяч шагов, что замедляет генерацию. Для ускорения используются методы дистилляции (например, Progressive Distillation) и решатели SDE (например, DPM-Solver).
- Большой объём памяти: модели содержат миллиарды параметров (например, Stable Diffusion 3 — 8 млрд параметров) и требуют видеокарт с большим объёмом VRAM.
- Трудности с точным контролем: несмотря на CFG, модели могут генерировать нежелательные детали (артефакты, искажения пропорций, неправильные конечности).
- Этические проблемы: возможность генерации дипфейков, порнографии, насилия и другого нежелательного контента. Для борьбы с этим используются фильтры и модерация.
Интересные факты
- Первая публичная демонстрация диффузионной модели, способной генерировать изображения по тексту, была проведена компанией OpenAI в 2021 году с моделью DALL-E.
- Модель Stable Diffusion была выпущена в открытом доступе в 2022 году, что привело к взрывному росту числа приложений и исследований в этой области.
- В 2023 году диффузионные модели начали использоваться для генерации трёхмерных объектов, что открыло перспективы для автоматизации в игровой индустрии и архитектуре.
- В России диффузионные модели развиваются в рамках национальных проектов по искусственному интеллекту, в частности, модель Kandinsky 3.0 (Сбер) поддерживает генерацию изображений и видео.
Источники
- Ho, J., Jain, A., & Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. Advances in Neural Information Processing Systems.
- Song, Y., & Ermon, S. (2020). Generative Modeling by Estimating Gradients of the Data Distribution. Advances in Neural Information Processing Systems.
- Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Dhariwal, P., & Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. Advances in Neural Information Processing Systems.
- OpenAI. (2024). Video generation models as world simulators (Sora).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →