Бинаризация изображений
Бинаризация изображений — это процесс преобразования полутонового или цветного цифрового изображения в двухцветное (бинарное), в котором каждый пиксель может принимать только одно из двух возможных значений, обычно 0 (чёрный) и 1 (белый). Бинаризация является одним из базовых методов предварительной обработки изображений в компьютерном зрении, распознавании образов и цифровой обработке сигналов, позволяя упростить последующий анализ, выделить контуры объектов и снизить вычислительную нагрузку.
Принцип работы
Бинаризация основана на сравнении значения яркости (или интенсивности) каждого пикселя исходного изображения с некоторым пороговым значением (T). Если значение пикселя превышает порог, ему присваивается одно состояние (например, белый цвет), в противном случае — другое (чёрный). Математически это выражается формулой:
\[ B(x, y) = \begin{cases} 1, & \text{если } I(x, y) > T \\ 0, & \text{иначе} \end{cases} \]
где \(I(x, y)\) — яркость исходного пикселя, \(B(x, y)\) — значение бинарного изображения. Для цветных изображений бинаризация обычно выполняется после предварительного преобразования в оттенки серого, хотя возможны и методы, работающие с цветовыми каналами.
Классификация методов бинаризации
Методы бинаризации делятся на две основные группы: глобальные и локальные (адаптивные). Выбор метода зависит от характера изображения, степени освещённости, наличия шумов и требуемой точности.
Глобальная бинаризация
При глобальной бинаризации используется единый порог для всего изображения. Основные методы:
- Метод Отсу (Otsu) — автоматический выбор порога, минимизирующий внутриклассовую дисперсию яркостей пикселей. Алгоритм предполагает, что гистограмма яркости изображения имеет два пика (бимодальное распределение), соответствующие объекту и фону. Метод Отсу широко применяется благодаря своей простоте и эффективности для изображений с равномерным освещением.
- Метод по среднему значению — порог устанавливается как средняя яркость пикселей изображения. Прост, но чувствителен к перепадам освещённости.
- Метод по медиане — порог равен медианному значению яркости. Устойчивее к выбросам, чем среднее, но также не учитывает локальные особенности.
- Метод по проценту чёрных пикселей — порог выбирается так, чтобы доля чёрных пикселей на выходе соответствовала заданному проценту (например, 50%).
Глобальные методы просты в реализации, но дают плохие результаты при неравномерном освещении, градиентах яркости или наличии теней.
Локальная (адаптивная) бинаризация
Локальная бинаризация вычисляет порог для каждого пикселя на основе анализа его окрестности (окна заданного размера). Это позволяет компенсировать локальные изменения освещённости.
- Метод Бернсена (Bernsen) — порог определяется как среднее между минимальной и максимальной яркостью в окне. Если контраст в окне мал (разность яркостей ниже порога), пиксель относится к фону, иначе — сравнивается с порогом.
- Метод Ниблэка (Niblack) — порог вычисляется как среднее яркости в окне минус коэффициент, умноженный на стандартное отклонение. Формула: \(T = m + k \cdot s\), где \(m\) — среднее, \(s\) — стандартное отклонение, \(k\) — эмпирический коэффициент (обычно отрицательный, например, -0.2). Метод хорошо работает для текста на неравномерном фоне.
- Метод Сауволы (Sauvola) — модификация метода Ниблэка, где порог дополнительно нормализуется относительно гипотетического динамического диапазона яркости. Формула: \(T = m \cdot (1 + k \cdot (s / R - 1))\), где \(R\) — максимальное стандартное отклонение (обычно 128 для 8-битных изображений). Метод более устойчив к шумам.
- Метод Брэдли (Bradley) — быстрый адаптивный метод, использующий интегральные изображения для вычисления среднего в окне. Порог устанавливается как доля (например, 85–95%) от среднего значения. Эффективен для обработки больших изображений в реальном времени.
Локальные методы требуют больше вычислительных ресурсов, но обеспечивают лучшие результаты на сложных изображениях.
Применение
Бинаризация является ключевым этапом во многих областях:
- Распознавание текста (OCR) — бинаризация страниц документов, книг, рукописей для выделения символов на фоне. В системах оптического распознавания символов (например, Tesseract) бинаризация — один из первых шагов.
- Обработка медицинских изображений — выделение границ органов, сосудов, клеток на рентгеновских снимках, МРТ, гистологических препаратах. Например, бинаризация используется для сегментации лейкоцитов в мазках крови.
- Анализ промышленных дефектов — обнаружение трещин, царапин, включений на поверхности материалов. Бинаризация позволяет отделить дефекты от однородного фона.
- Биометрия — выделение отпечатков пальцев, радужной оболочки глаза, сетчатки. Бинаризация упрощает построение шаблонов для идентификации.
- Робототехника и автономное вождение — выделение дорожной разметки, знаков, препятствий на изображениях с камер. Бинаризация применяется в системах помощи водителю (ADAS).
- Цифровая фотография и дизайн — создание эффектов «чёрно-белого рисунка», трассировка контуров для векторной графики, подготовка изображений для лазерной гравировки.
Критика и ограничения
Основные недостатки бинаризации связаны с потерей информации: все полутона и цветовые нюансы сводятся к двум значениям, что может привести к потере мелких деталей, разрыву тонких линий или слиянию близко расположенных объектов. Глобальные методы особенно уязвимы к перепадам освещённости, а локальные — к выбору размера окна: слишком маленькое окно увеличивает шум, слишком большое — сглаживает локальные особенности.
Для изображений с сильным шумом (например, старые фотографии, сканированные микрофильмы) бинаризация может давать артефакты, такие как «соль и перец» (случайные чёрные и белые точки). В таких случаях перед бинаризацией применяют фильтры (медианный, гауссовский) или используют методы, устойчивые к шуму (например, метод Сауволы).
Альтернативные подходы
Вместо бинаризации в современных системах компьютерного зрения часто применяются более сложные методы сегментации, сохраняющие больше информации: пороговая обработка с несколькими уровнями (мультипороговая), кластеризация (K-means, DBSCAN), нейросетевые методы (свёрточные нейронные сети, U-Net). Однако бинаризация остаётся востребованной благодаря своей скорости, простоте реализации и низким требованиям к вычислительным ресурсам, особенно в встраиваемых системах и мобильных устройствах.
Интересные факты
- Первые алгоритмы бинаризации появились в 1960-х годах в связи с развитием систем автоматического чтения текстов (OCR). Метод Отсу, опубликованный в 1979 году, до сих пор является одним из самых цитируемых в области обработки изображений.
- В некоторых системах бинаризация выполняется аппаратно — на уровне видеокамеры или специализированного процессора (например, FPGA), что позволяет обрабатывать видеопоток в реальном времени без загрузки центрального процессора.
- В задачах обработки исторических документов бинаризация осложняется наличием выцветших чернил, пятен, складок бумаги. Для таких случаев разработаны специализированные методы, например, на основе вейвлет-преобразований.
Источники
- Гонсалес Р., Вудс Р. Цифровая обработка изображений. — М.: Техносфера, 2012.
- Otsu N. A Threshold Selection Method from Gray-Level Histograms // IEEE Transactions on Systems, Man, and Cybernetics. — 1979. — Vol. 9, No. 1. — P. 62–66.
- Sauvola J., Pietikäinen M. Adaptive document image binarization // Pattern Recognition. — 2000. — Vol. 33, No. 2. — P. 225–236.
- Bradley D., Roth G. Adaptive Thresholding using the Integral Image // Journal of Graphics Tools. — 2007. — Vol. 12, No. 2. — P. 13–21.
- Шапиро Л., Стокман Дж. Компьютерное зрение. — М.: Бином. Лаборатория знаний, 2006.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →