Открыть сервис

Матрица Грама в обработке изображений

Матрица Грама в обработке изображений — это квадратная матрица, элементы которой представляют собой скалярные произведения векторов признаков, извлечённых из изображения. Она описывает корреляцию между различными каналами (картами активации) на определённом слое свёрточной нейронной сети, отражая статистическую взаимосвязь текстур и цветовых паттернов без учёта их пространственного расположения.

Определение и математическая основа

В контексте глубокого обучения матрица Грама строится на основе тензора активаций, получаемого после прохождения изображения через свёрточную сеть (например, VGG-19). Пусть \(F\) — тензор активаций размером \(C \times H \times W\), где \(C\) — число каналов (фильтров), \(H\) и \(W\) — высота и ширина карты признаков. Тогда матрица Грама \(G\) размером \(C \times C\) вычисляется по формуле:

\[ G_{ij} = \sum_{k=1}^{H \cdot W} F_{ik} \cdot F_{jk} \]

где \(F_{ik}\) — значение \(i\)-го канала в позиции \(k\) (после векторизации пространственных координат). Фактически, матрица Грама представляет собой нецентрированную ковариационную матрицу признаков, нормированную на количество пространственных позиций (деление на \(H \cdot W\) часто применяется для стабилизации масштаба).

Ключевое свойство матрицы Грама — инвариантность к пространственному расположению объектов. Поскольку суммирование выполняется по всем позициям, информация о том, где именно находится текстура или цвет, теряется, но сохраняется информация о том, насколько сильно каналы активируются совместно. Это делает матрицу Грама эффективным дескриптором стиля, но не содержания изображения.

Применение в нейросетевых алгоритмах

Перенос стиля (Neural Style Transfer)

Наиболее известное применение матрицы Грама связано с алгоритмом переноса стиля, предложенным Леоном Гатисом и соавторами в 2015 году. В этой задаче изображение синтезируется таким образом, чтобы одновременно минимизировать два типа потерь:

  • Потеря содержания — вычисляется как среднеквадратичная ошибка между картами активаций исходного изображения и генерируемого на определённом слое сети.
  • Потеря стиля — вычисляется как среднеквадратичная ошибка между матрицами Грама, построенными для стилевого эталона и генерируемого изображения.

Минимизация потери стиля приводит к тому, что статистические взаимосвязи между каналами активаций синтезированного изображения приближаются к взаимосвязям эталона, что визуально проявляется в переносе текстур, цветовых сочетаний и ритма мазков.

Улучшенные варианты и нормализация

В последующих работах, таких как Instance Normalization (2016) и Adaptive Instance Normalization (AdaIN), матрица Грама была заменена на более простые статистики — среднее и стандартное отклонение каналов. Однако матрица Грама остаётся эталонным методом для задач, где требуется точная передача сложных текстурных взаимодействий. Современные архитектуры, например StyleGAN, используют модифицированные версии корреляционных матриц для управления стилем генерируемых изображений.

Анализ текстур и стилометрия

Помимо генерации, матрица Грама применяется в задачах анализа и классификации текстур. Поскольку она компактно описывает микроструктуру изображения, её используют для:

  • поиска изображений по визуальному сходству стиля;
  • атрибуции произведений искусства (определение художника по мазкам и цветовой гамме);
  • обнаружения аномалий на текстурированных поверхностях (например, дефектов ткани или металла).

Ограничения и критика

Основным ограничением матрицы Грама является потеря пространственной информации. Это делает её непригодной для задач, где важна композиция или расположение объектов. Кроме того, вычисление матрицы Грама для больших тензоров требует значительных вычислительных ресурсов и памяти, особенно при высоком разрешении изображений.

Критике подвергается и сама концепция «стиля» как набора корреляций признаков: в ряде работ (например, Rethinking Style Transfer, 2017) показано, что матрица Грама не полностью отражает перцептивные свойства стиля, а её минимизация может приводить к артефактам, таким как перенос шума или потеря локальных контрастов.

Источники

  • Gatys L., Ecker A., Bethge M. A Neural Algorithm of Artistic Style (2015).
  • Ulyanov D., Vedaldi A., Lempitsky V. Instance Normalization: The Missing Ingredient for Fast Stylization (2016).
  • Huang X., Belongie S. Arbitrary Style Transfer in Real-time with Adaptive Instance Normalization (2017).
  • Li Y., Wang N., Liu J., Hou X. Demystifying Neural Style Transfer (2017).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →