Бинарная классификация
Бинарная классификация — это задача классификации объектов на два взаимоисключающих класса на основе набора признаков. В машинном обучении и статистике она относится к типу задач обучения с учителем, где для каждого объекта обучающей выборки известна метка одного из двух возможных классов. Бинарная классификация является частным, но наиболее распространённым случаем многоклассовой классификации и лежит в основе множества прикладных систем, от фильтрации спама до медицинской диагностики.
Формальная постановка задачи
Пусть задано множество объектов \( X \) и множество меток классов \( Y = \{0, 1\} \) (или \( \{-1, +1\} \), или \( \text{«да»/«нет»} \)). Имеется обучающая выборка \( \{(x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)\} \), где \( x_i \in X \) — описание объекта (вектор признаков), а \( y_i \in Y \) — истинная метка класса. Требуется построить алгоритм (классификатор) \( f: X \to Y \), который для любого нового объекта \( x \) предсказывал бы его метку класса \( \hat{y} = f(x) \) с минимальной ошибкой.
Классы в бинарной классификации часто называют положительным (positive, обычно метка 1) и отрицательным (negative, метка 0). Выбор, какой класс считать положительным, зависит от контекста задачи. Например, в задаче обнаружения спама положительным классом является «спам», а отрицательным — «не спам».
Оценка качества
Для оценки качества бинарного классификатора используются метрики, основанные на сравнении предсказанных меток с истинными. Результаты классификации сводятся в матрицу ошибок (confusion matrix), которая содержит четыре значения:
- True Positive (TP) — истинно положительные: объекты положительного класса, правильно отнесённые к положительному.
- True Negative (TN) — истинно отрицательные: объекты отрицательного класса, правильно отнесённые к отрицательному.
- False Positive (FP) — ложно положительные (ошибка I рода): объекты отрицательного класса, ошибочно отнесённые к положительному.
- False Negative (FN) — ложно отрицательные (ошибка II рода): объекты положительного класса, ошибочно отнесённые к отрицательному.
На основе матрицы ошибок вычисляются основные метрики:
- Accuracy (точность) — доля правильных ответов: \( \frac{TP + TN}{TP + TN + FP + FN} \). Неинформативна при сильном дисбалансе классов.
- Precision (точность положительных предсказаний) — доля истинно положительных среди всех объектов, отнесённых к положительному классу: \( \frac{TP}{TP + FP} \).
- Recall (полнота) — доля истинно положительных, найденных классификатором, среди всех объектов положительного класса: \( \frac{TP}{TP + FN} \).
- F1-мера — гармоническое среднее precision и recall: \( 2 \cdot \frac{Precision \cdot Recall}{Precision + Recall} \). Используется как сбалансированная метрика.
- ROC-AUC — площадь под ROC-кривой (Receiver Operating Characteristic). Показывает способность классификатора разделять классы при различных порогах решающего правила; значение 1 соответствует идеальному классификатору, 0,5 — случайному.
Выбор метрики зависит от задачи. Например, в медицинской диагностике важнее минимизировать ложноотрицательные результаты (высокий recall), а в системах антиспама — ложно положительные (высокий precision).
Методы бинарной классификации
Существует множество алгоритмов, применимых для бинарной классификации. Они различаются по принципу работы, сложности, интерпретируемости и области применения.
Линейные модели
- Логистическая регрессия (logistic regression) — несмотря на название, является методом классификации. Оценивает вероятность принадлежности объекта к положительному классу с помощью логистической функции: \( P(y=1|x) = \sigma(w^T x + b) \), где \( \sigma(z) = 1/(1+e^{-z}) \). Порог принятия решения обычно равен 0,5. Проста, интерпретируема, хорошо работает на линейно разделимых данных.
- Метод опорных векторов (SVM) с линейным ядром — строит разделяющую гиперплоскость, максимизирующую отступ (margin) между классами. Эффективен в задачах с большим числом признаков.
Деревья решений и ансамбли
- Дерево решений (decision tree) — последовательность правил «если-то», разбивающих пространство признаков на области. Интерпретируемо, но склонно к переобучению.
- Случайный лес (random forest) — ансамбль из множества деревьев решений, каждое из которых обучается на случайной подвыборке данных и признаков. Итоговое решение принимается голосованием. Устойчив к переобучению, хорошо работает с разнородными данными.
- Градиентный бустинг (Gradient Boosting, XGBoost, LightGBM, CatBoost) — последовательное построение деревьев, каждое из которых исправляет ошибки предыдущих. Один из самых эффективных методов на табличных данных.
Нейронные сети
- Многослойный перцептрон (MLP) — полносвязная нейронная сеть с одним или несколькими скрытыми слоями. На выходном слое используется сигмоидная функция активации для получения вероятности. Способен аппроксимировать сложные нелинейные зависимости.
- Свёрточные нейронные сети (CNN) — применяются для классификации изображений (например, определение, есть ли на снимке объект).
- Рекуррентные нейронные сети (RNN) и трансформеры — используются для классификации текстов и последовательностей (например, анализ тональности отзыва).
Другие методы
- k-ближайших соседей (k-NN) — классифицирует объект по большинству среди k ближайших объектов обучающей выборки. Не требует обучения, но чувствителен к масштабу признаков и объёму данных.
- Наивный байесовский классификатор — основан на теореме Байеса и предположении о независимости признаков. Прост, быстр, эффективен для текстовой классификации (например, фильтрация спама).
Применение
Бинарная классификация широко используется в различных областях:
- Фильтрация спама — классификация электронных писем на «спам» и «не спам».
- Медицинская диагностика — определение наличия заболевания (например, «болен» / «здоров») по результатам анализов, снимкам или симптомам.
- Кредитный скоринг — оценка вероятности дефолта заёмщика («надёжный» / «ненадёжный»).
- Обнаружение мошеннических транзакций — выявление аномальных операций в банковских системах («мошенничество» / «легитимная операция»).
- Анализ тональности текста — определение эмоциональной окраски отзыва или сообщения («положительный» / «отрицательный»).
- Распознавание объектов — бинарная классификация может быть подзадачей в системах компьютерного зрения (например, «есть пешеход» / «нет пешехода» на кадре).
- Биометрия — верификация личности («свой» / «чужой») по отпечатку пальца, лицу или голосу.
Особенности и проблемы
Дисбаланс классов
Одна из наиболее частых проблем бинарной классификации — дисбаланс классов, когда один класс (обычно положительный) встречается значительно реже другого. Например, в задаче обнаружения мошеннических транзакций доля мошеннических операций может составлять 0,1 %. В таких случаях accuracy становится обманчивой метрикой, так как классификатор, предсказывающий всегда отрицательный класс, будет иметь accuracy 99,9 %, но не будет обнаруживать мошенничество. Для борьбы с дисбалансом применяются:
- Ресемплинг: увеличение числа примеров меньшинства (oversampling, например, метод SMOTE) или уменьшение числа примеров большинства (undersampling).
- Использование взвешенных функций потерь, где ошибка на примерах меньшинства штрафуется сильнее.
- Применение метрик, устойчивых к дисбалансу (precision, recall, F1-мера, ROC-AUC).
Выбор порога решающего правила
Многие алгоритмы (логистическая регрессия, нейронные сети) выдают вероятность принадлежности к классу, а не жёсткую метку. Для получения бинарного решения необходимо выбрать порог (threshold). По умолчанию часто используется 0,5, но в зависимости от задачи порог может быть смещён. Например, при диагностике опасного заболевания порог может быть снижен, чтобы уменьшить количество пропущенных случаев (ложноотрицательных результатов), даже ценой увеличения ложноположительных.
Интерпретируемость
В некоторых областях (медицина, юриспруденция, финансы) требуется, чтобы модель не только давала прогноз, но и объясняла его. Линейные модели и деревья решений обладают высокой интерпретируемостью, в то время как нейронные сети и ансамблевые методы часто рассматриваются как «чёрные ящики». Для повышения интерпретируемости сложных моделей используются методы объяснения, такие как SHAP (SHapley Additive exPlanations) и LIME (Local Interpretable Model-agnostic Explanations).
Связь с другими задачами
Бинарная классификация является частным случаем многоклассовой классификации, где число классов равно двум. Многие алгоритмы многоклассовой классификации (например, метод опорных векторов, логистическая регрессия) изначально разработаны для бинарного случая и обобщаются на несколько классов с помощью стратегий «один против всех» (one-vs-rest) или «один против одного» (one-vs-one).
Также бинарная классификация тесно связана с задачами регрессии (когда прогнозируется непрерывная величина) и ранжирования (когда объекты упорядочиваются по степени принадлежности к классу).
Источники
- Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction. Springer.
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
- James, G., Witten, D., Hastie, T., Tibshirani, R. (2013). An Introduction to Statistical Learning: with Applications in R. Springer.
- Гудфеллоу, Я., Бенджио, И., Курвилль, А. (2016). Глубокое обучение. ДМК Пресс.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →