AdaIN: адаптивная нормализация экземпляров¶
AdaIN (от англ. Adaptive Instance Normalization — адаптивная нормализация экземпляров) — метод нормализации признаков в свёрточных нейронных сетях, предназначенный для переноса стиля изображения. В отличие от стандартной нормализации экземпляра (Instance Normalization), AdaIN не использует статистики самого обрабатываемого изображения, а адаптирует их к статистикам целевого стиля, что позволяет управлять стилизацией в реальном времени на одном проходе сети.
¶Принцип работы
AdaIN была предложена в 2017 году исследователями из Корнеллского университета (Xun Huang и Serge Belongie) в работе «Arbitrary Style Transfer in Real-time with Adaptive Instance Normalization». Метод основан на свойствах нормализации экземпляра, которая вычисляет среднее и стандартное отклонение для каждого канала признаков отдельного изображения.
Формально AdaIN определяется следующим образом. Пусть \( x \) — карта признаков контентного изображения, а \( y \) — карта признаков стилевого изображения. Тогда выход AdaIN вычисляется по формуле:
\[ \text{AdaIN}(x, y) = \sigma(y) \left( \frac{x - \mu(x)}{\sigma(x)} \right) + \mu(y) \]
где \( \mu(x) \) и \( \sigma(x) \) — среднее и стандартное отклонение каналов признаков \( x \), а \( \mu(y) \) и \( \sigma(y) \) — соответствующие статистики для \( y \). Таким образом, AdaIN нормализует контентное изображение (приводит его к нулевому среднему и единичной дисперсии) и затем масштабирует и сдвигает его в соответствии со статистиками стилевого изображения.
Ключевое отличие от предшествующих методов (например, Batch Normalization или Instance Normalization) состоит в том, что параметры масштабирования и сдвига не являются обучаемыми константами, а вычисляются динамически из входного стилевого изображения. Это позволяет сети обрабатывать произвольные стили без необходимости переобучения для каждого нового стиля.
¶Архитектура сети
В оригинальной работе AdaIN используется сеть-энкодер на базе предобученной VGG-19 (глубокая свёрточная сеть для классификации изображений), которая извлекает признаки контента и стиля. Стилизация выполняется на нескольких уровнях абстракции:
- Энкодер преобразует входные изображения в карты признаков.
- На определённом слое (обычно relu4_1) применяется AdaIN для объединения контентных и стилевых признаков.
- Дешифратор (обучаемая часть сети) восстанавливает изображение из стилизованных признаков.
Дешифратор обучается таким образом, чтобы восстановленное изображение имело те же статистики признаков, что и целевой стиль, на всех уровнях энкодера. Это достигается с помощью функции потерь, включающей перцептивные потери (perceptual losses) на основе VGG.
¶Преимущества и ограничения
Основные преимущества AdaIN:
- Произвольность стилей: сеть может обрабатывать любые стилевые изображения на этапе инференса без переобучения.
- Скорость: стилизация выполняется за один прямой проход сети, что позволяет достигать реального времени на современных GPU.
- Простота реализации: метод не требует сложных итеративных оптимизаций, как ранние подходы (например, метод Гатиса).
Ограничения метода:
- Качество стилизации: AdaIN передаёт только глобальные статистики (среднее и дисперсию), что может приводить к потере мелких текстурных деталей по сравнению с методами, использующими более высокие моменты распределения.
- Артефакты: при сильном различии контента и стиля возможны искажения структуры изображения.
- Зависимость от энкодера: качество работы сильно зависит от предобученной VGG-сети, которая обучена на распознавание объектов, а не на стилизацию.
¶Применение
AdaIN стала основой для ряда последующих методов переноса стиля, включая:
- WCT (Whitening and Coloring Transform) — расширение идеи на основе декорреляции признаков.
- StyleGAN — генеративные состязательные сети используют модификации AdaIN (например, AdaIN для управления стилем в синтезе изображений).
- SANet (Style-Attention Network) — гибридные подходы, сочетающие AdaIN с механизмами внимания.
Кроме переноса стиля, AdaIN применяется в задачах фотореалистичной стилизации, преобразования черно-белых изображений в цветные, а также в задачах улучшения разрешения изображений.
¶См. также
- Нормализация экземпляра
- Перенос стиля
- Свёрточная нейронная сеть
- VGG-19
¶Литература
- Huang X., Belongie S. Arbitrary Style Transfer in Real-time with Adaptive Instance Normalization // Proceedings of the IEEE International Conference on Computer Vision (ICCV), 2017.
- Ulyanov D., Vedaldi A., Lempitsky V. Instance Normalization: The Missing Ingredient for Fast Stylization // arXiv preprint arXiv:1607.08022, 2016.
- Karras T., Laine S., Aila T. A Style-Based Generator Architecture for Generative Adversarial Networks // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2019.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


