Открыть сервис

Бинарная классификация

Бинарная классификация — это задача классификации объектов на два взаимоисключающих класса на основе набора признаков. В машинном обучении и статистике она относится к типу задач обучения с учителем, где для каждого объекта обучающей выборки известна метка одного из двух возможных классов. Бинарная классификация является частным, но наиболее распространённым случаем многоклассовой классификации и лежит в основе множества прикладных систем, от фильтрации спама до медицинской диагностики.

Формальная постановка задачи

Пусть задано множество объектов \( X \) и множество меток классов \( Y = \{0, 1\} \) (или \( \{-1, +1\} \), или \( \text{«да»/«нет»} \)). Имеется обучающая выборка \( \{(x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)\} \), где \( x_i \in X \) — описание объекта (вектор признаков), а \( y_i \in Y \) — истинная метка класса. Требуется построить алгоритм (классификатор) \( f: X \to Y \), который для любого нового объекта \( x \) предсказывал бы его метку класса \( \hat{y} = f(x) \) с минимальной ошибкой.

Классы в бинарной классификации часто называют положительным (positive, обычно метка 1) и отрицательным (negative, метка 0). Выбор, какой класс считать положительным, зависит от контекста задачи. Например, в задаче обнаружения спама положительным классом является «спам», а отрицательным — «не спам».

Оценка качества

Для оценки качества бинарного классификатора используются метрики, основанные на сравнении предсказанных меток с истинными. Результаты классификации сводятся в матрицу ошибок (confusion matrix), которая содержит четыре значения:

  • True Positive (TP) — истинно положительные: объекты положительного класса, правильно отнесённые к положительному.
  • True Negative (TN) — истинно отрицательные: объекты отрицательного класса, правильно отнесённые к отрицательному.
  • False Positive (FP) — ложно положительные (ошибка I рода): объекты отрицательного класса, ошибочно отнесённые к положительному.
  • False Negative (FN) — ложно отрицательные (ошибка II рода): объекты положительного класса, ошибочно отнесённые к отрицательному.

На основе матрицы ошибок вычисляются основные метрики:

  • Accuracy (точность) — доля правильных ответов: \( \frac{TP + TN}{TP + TN + FP + FN} \). Неинформативна при сильном дисбалансе классов.
  • Precision (точность положительных предсказаний) — доля истинно положительных среди всех объектов, отнесённых к положительному классу: \( \frac{TP}{TP + FP} \).
  • Recall (полнота) — доля истинно положительных, найденных классификатором, среди всех объектов положительного класса: \( \frac{TP}{TP + FN} \).
  • F1-мера — гармоническое среднее precision и recall: \( 2 \cdot \frac{Precision \cdot Recall}{Precision + Recall} \). Используется как сбалансированная метрика.
  • ROC-AUC — площадь под ROC-кривой (Receiver Operating Characteristic). Показывает способность классификатора разделять классы при различных порогах решающего правила; значение 1 соответствует идеальному классификатору, 0,5 — случайному.

Выбор метрики зависит от задачи. Например, в медицинской диагностике важнее минимизировать ложноотрицательные результаты (высокий recall), а в системах антиспама — ложно положительные (высокий precision).

Методы бинарной классификации

Существует множество алгоритмов, применимых для бинарной классификации. Они различаются по принципу работы, сложности, интерпретируемости и области применения.

Линейные модели

  • Логистическая регрессия (logistic regression) — несмотря на название, является методом классификации. Оценивает вероятность принадлежности объекта к положительному классу с помощью логистической функции: \( P(y=1|x) = \sigma(w^T x + b) \), где \( \sigma(z) = 1/(1+e^{-z}) \). Порог принятия решения обычно равен 0,5. Проста, интерпретируема, хорошо работает на линейно разделимых данных.
  • Метод опорных векторов (SVM) с линейным ядром — строит разделяющую гиперплоскость, максимизирующую отступ (margin) между классами. Эффективен в задачах с большим числом признаков.

Деревья решений и ансамбли

  • Дерево решений (decision tree) — последовательность правил «если-то», разбивающих пространство признаков на области. Интерпретируемо, но склонно к переобучению.
  • Случайный лес (random forest) — ансамбль из множества деревьев решений, каждое из которых обучается на случайной подвыборке данных и признаков. Итоговое решение принимается голосованием. Устойчив к переобучению, хорошо работает с разнородными данными.
  • Градиентный бустинг (Gradient Boosting, XGBoost, LightGBM, CatBoost) — последовательное построение деревьев, каждое из которых исправляет ошибки предыдущих. Один из самых эффективных методов на табличных данных.

Нейронные сети

  • Многослойный перцептрон (MLP) — полносвязная нейронная сеть с одним или несколькими скрытыми слоями. На выходном слое используется сигмоидная функция активации для получения вероятности. Способен аппроксимировать сложные нелинейные зависимости.
  • Свёрточные нейронные сети (CNN) — применяются для классификации изображений (например, определение, есть ли на снимке объект).
  • Рекуррентные нейронные сети (RNN) и трансформеры — используются для классификации текстов и последовательностей (например, анализ тональности отзыва).

Другие методы

  • k-ближайших соседей (k-NN) — классифицирует объект по большинству среди k ближайших объектов обучающей выборки. Не требует обучения, но чувствителен к масштабу признаков и объёму данных.
  • Наивный байесовский классификатор — основан на теореме Байеса и предположении о независимости признаков. Прост, быстр, эффективен для текстовой классификации (например, фильтрация спама).

Применение

Бинарная классификация широко используется в различных областях:

  • Фильтрация спамаклассификация электронных писем на «спам» и «не спам».
  • Медицинская диагностика — определение наличия заболевания (например, «болен» / «здоров») по результатам анализов, снимкам или симптомам.
  • Кредитный скоринг — оценка вероятности дефолта заёмщика («надёжный» / «ненадёжный»).
  • Обнаружение мошеннических транзакций — выявление аномальных операций в банковских системах («мошенничество» / «легитимная операция»).
  • Анализ тональности текста — определение эмоциональной окраски отзыва или сообщения («положительный» / «отрицательный»).
  • Распознавание объектов — бинарная классификация может быть подзадачей в системах компьютерного зрения (например, «есть пешеход» / «нет пешехода» на кадре).
  • Биометрияверификация личности («свой» / «чужой») по отпечатку пальца, лицу или голосу.

Особенности и проблемы

Дисбаланс классов

Одна из наиболее частых проблем бинарной классификации — дисбаланс классов, когда один класс (обычно положительный) встречается значительно реже другого. Например, в задаче обнаружения мошеннических транзакций доля мошеннических операций может составлять 0,1 %. В таких случаях accuracy становится обманчивой метрикой, так как классификатор, предсказывающий всегда отрицательный класс, будет иметь accuracy 99,9 %, но не будет обнаруживать мошенничество. Для борьбы с дисбалансом применяются:

  • Ресемплинг: увеличение числа примеров меньшинства (oversampling, например, метод SMOTE) или уменьшение числа примеров большинства (undersampling).
  • Использование взвешенных функций потерь, где ошибка на примерах меньшинства штрафуется сильнее.
  • Применение метрик, устойчивых к дисбалансу (precision, recall, F1-мера, ROC-AUC).

Выбор порога решающего правила

Многие алгоритмы (логистическая регрессия, нейронные сети) выдают вероятность принадлежности к классу, а не жёсткую метку. Для получения бинарного решения необходимо выбрать порог (threshold). По умолчанию часто используется 0,5, но в зависимости от задачи порог может быть смещён. Например, при диагностике опасного заболевания порог может быть снижен, чтобы уменьшить количество пропущенных случаев (ложноотрицательных результатов), даже ценой увеличения ложноположительных.

Интерпретируемость

В некоторых областях (медицина, юриспруденция, финансы) требуется, чтобы модель не только давала прогноз, но и объясняла его. Линейные модели и деревья решений обладают высокой интерпретируемостью, в то время как нейронные сети и ансамблевые методы часто рассматриваются как «чёрные ящики». Для повышения интерпретируемости сложных моделей используются методы объяснения, такие как SHAP (SHapley Additive exPlanations) и LIME (Local Interpretable Model-agnostic Explanations).

Связь с другими задачами

Бинарная классификация является частным случаем многоклассовой классификации, где число классов равно двум. Многие алгоритмы многоклассовой классификации (например, метод опорных векторов, логистическая регрессия) изначально разработаны для бинарного случая и обобщаются на несколько классов с помощью стратегий «один против всех» (one-vs-rest) или «один против одного» (one-vs-one).

Также бинарная классификация тесно связана с задачами регрессии (когда прогнозируется непрерывная величина) и ранжирования (когда объекты упорядочиваются по степени принадлежности к классу).

Источники

  • Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction. Springer.
  • Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
  • James, G., Witten, D., Hastie, T., Tibshirani, R. (2013). An Introduction to Statistical Learning: with Applications in R. Springer.
  • Гудфеллоу, Я., Бенджио, И., Курвилль, А. (2016). Глубокое обучение. ДМК Пресс.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →