Открыть сервис

AdaIN: адаптивная нормализация экземпляров

AdaIN (от англ. Adaptive Instance Normalization — адаптивная нормализация экземпляров) — метод нормализации признаков в свёрточных нейронных сетях, предназначенный для переноса стиля изображения. В отличие от стандартной нормализации экземпляра (Instance Normalization), AdaIN не использует статистики самого обрабатываемого изображения, а адаптирует их к статистикам целевого стиля, что позволяет управлять стилизацией в реальном времени на одном проходе сети.

Принцип работы

AdaIN была предложена в 2017 году исследователями из Корнеллского университета (Xun Huang и Serge Belongie) в работе «Arbitrary Style Transfer in Real-time with Adaptive Instance Normalization». Метод основан на свойствах нормализации экземпляра, которая вычисляет среднее и стандартное отклонение для каждого канала признаков отдельного изображения.

Формально AdaIN определяется следующим образом. Пусть \( x \) — карта признаков контентного изображения, а \( y \) — карта признаков стилевого изображения. Тогда выход AdaIN вычисляется по формуле:

\[ \text{AdaIN}(x, y) = \sigma(y) \left( \frac{x - \mu(x)}{\sigma(x)} \right) + \mu(y) \]

где \( \mu(x) \) и \( \sigma(x) \) — среднее и стандартное отклонение каналов признаков \( x \), а \( \mu(y) \) и \( \sigma(y) \) — соответствующие статистики для \( y \). Таким образом, AdaIN нормализует контентное изображение (приводит его к нулевому среднему и единичной дисперсии) и затем масштабирует и сдвигает его в соответствии со статистиками стилевого изображения.

Ключевое отличие от предшествующих методов (например, Batch Normalization или Instance Normalization) состоит в том, что параметры масштабирования и сдвига не являются обучаемыми константами, а вычисляются динамически из входного стилевого изображения. Это позволяет сети обрабатывать произвольные стили без необходимости переобучения для каждого нового стиля.

Архитектура сети

В оригинальной работе AdaIN используется сеть-энкодер на базе предобученной VGG-19 (глубокая свёрточная сеть для классификации изображений), которая извлекает признаки контента и стиля. Стилизация выполняется на нескольких уровнях абстракции:

  1. Энкодер преобразует входные изображения в карты признаков.
  2. На определённом слое (обычно relu4_1) применяется AdaIN для объединения контентных и стилевых признаков.
  3. Дешифратор (обучаемая часть сети) восстанавливает изображение из стилизованных признаков.

Дешифратор обучается таким образом, чтобы восстановленное изображение имело те же статистики признаков, что и целевой стиль, на всех уровнях энкодера. Это достигается с помощью функции потерь, включающей перцептивные потери (perceptual losses) на основе VGG.

Преимущества и ограничения

Основные преимущества AdaIN:

  • Произвольность стилей: сеть может обрабатывать любые стилевые изображения на этапе инференса без переобучения.
  • Скорость: стилизация выполняется за один прямой проход сети, что позволяет достигать реального времени на современных GPU.
  • Простота реализации: метод не требует сложных итеративных оптимизаций, как ранние подходы (например, метод Гатиса).

Ограничения метода:

  • Качество стилизации: AdaIN передаёт только глобальные статистики (среднее и дисперсию), что может приводить к потере мелких текстурных деталей по сравнению с методами, использующими более высокие моменты распределения.
  • Артефакты: при сильном различии контента и стиля возможны искажения структуры изображения.
  • Зависимость от энкодера: качество работы сильно зависит от предобученной VGG-сети, которая обучена на распознавание объектов, а не на стилизацию.

Применение

AdaIN стала основой для ряда последующих методов переноса стиля, включая:

  • WCT (Whitening and Coloring Transform) — расширение идеи на основе декорреляции признаков.
  • StyleGAN — генеративные состязательные сети используют модификации AdaIN (например, AdaIN для управления стилем в синтезе изображений).
  • SANet (Style-Attention Network) — гибридные подходы, сочетающие AdaIN с механизмами внимания.

Кроме переноса стиля, AdaIN применяется в задачах фотореалистичной стилизации, преобразования черно-белых изображений в цветные, а также в задачах улучшения разрешения изображений.

См. также

Литература

  • Huang X., Belongie S. Arbitrary Style Transfer in Real-time with Adaptive Instance Normalization // Proceedings of the IEEE International Conference on Computer Vision (ICCV), 2017.
  • Ulyanov D., Vedaldi A., Lempitsky V. Instance Normalization: The Missing Ingredient for Fast Stylization // arXiv preprint arXiv:1607.08022, 2016.
  • Karras T., Laine S., Aila T. A Style-Based Generator Architecture for Generative Adversarial Networks // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2019.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →