Открыть сервис

Бинарная регрессия

Бинарная регрессия — это раздел статистического моделирования и машинного обучения, предназначенный для предсказания вероятности принадлежности наблюдения к одной из двух взаимоисключающих категорий (бинарный отклик). В отличие от линейной регрессии, которая предсказывает непрерывную величину, бинарная регрессия оценивает вероятность события, принимающего значения 0 или 1 (например, «да»/«нет», «успех»/«неудача», «болен»/«здоров»). Основными методами бинарной регрессии являются логистическая регрессия, пробит-регрессия и регрессия на основе логит-модели.

Математическая постановка задачи

Пусть \( Y \) — зависимая бинарная переменная, принимающая значения 0 или 1. Цель модели — оценить условную вероятность \( P(Y=1 | X) \), где \( X = (x_1, x_2, ..., x_k) \) — вектор независимых переменных (предикторов). В линейной регрессии предполагается, что \( E(Y|X) = X\beta \), но для бинарного отклика это приводит к недопустимым вероятностям (меньше 0 или больше 1). Поэтому бинарная регрессия использует нелинейную функцию связи \( F \), которая преобразует линейную комбинацию предикторов в интервал [0,1]:

\[ P(Y=1 | X) = F(X\beta) \]

где \( \beta \) — вектор коэффициентов, а \( F \) — монотонная функция распределения.

Основные модели

Логистическая регрессия (логит-модель)

Наиболее распространённый метод бинарной регрессии. Функция связи — логистическая функция:

\[ F(z) = \frac{1}{1 + e^{-z}} \]

где \( z = X\beta \). Модель оценивается методом максимального правдоподобия. Коэффициенты интерпретируются через отношение шансов (odds ratio): \( e^{\beta_j} \) показывает, во сколько раз изменяется шанс \( P/(1-P) \) при увеличении \( x_j \) на единицу.

Пробит-регрессия

Использует функцию распределения стандартного нормального закона:

\[ F(z) = \Phi(z) = \int_{-\infty}^{z} \frac{1}{\sqrt{2\pi}} e^{-t^2/2} dt \]

Пробит-модель часто применяется в экономике и биологии, когда предполагается, что бинарный исход возникает из-за скрытой (латентной) непрерывной переменной, превышающей порог.

Другие модели

  • Регрессия с дополнительным логарифмом (complementary log-log): \( F(z) = 1 - e^{-e^z} \), используется для асимметричных распределений.
  • Модель с линейной вероятностью (LPM): \( P = X\beta \), простая, но даёт вероятности вне [0,1] и гетероскедастичность.

Оценка и интерпретация

Метод максимального правдоподобия

Параметры моделей бинарной регрессии (кроме LPM) оцениваются итеративно (например, методом Ньютона-Рафсона). Функция правдоподобия для выборки из \( n \) наблюдений:

\[ L(\beta) = \prod_{i=1}^{n} [F(X_i\beta)]^{y_i} [1 - F(X_i\beta)]^{1 - y_i} \]

Предельные эффекты

Поскольку модель нелинейна, влияние предиктора на вероятность зависит от значения всех переменных. Предельный эффект для непрерывного предиктора \( x_j \) рассчитывается как:

\[ \frac{\partial P}{\partial x_j} = \beta_j \cdot f(X\beta) \]

где \( f \) — плотность распределения, соответствующая функции связи. Для дискретных предикторов вычисляют изменение вероятности при переходе от 0 к 1.

Качество модели

  • Псевдо-R² (Макфаддена, Коула, Нагелькерке) — аналоги коэффициента детерминации, но не имеют прямого смысла доли объяснённой дисперсии.
  • Информационные критерии (AIC, BIC) — для сравнения моделей.
  • ROC-кривая и AUC — оценка дискриминационной способности: AUC > 0.7 считается приемлемым, > 0.9 — отличным.
  • Тест Хосмера-Лемешоу — проверка калибровки модели.

Применение

Бинарная регрессия широко используется в различных областях:

Медицина

  • Прогнозирование наличия заболевания (например, диабета) по клиническим показателям.
  • Оценка вероятности летального исхода после операции.

Экономика и финансы

  • Модели кредитного скоринга: вероятность дефолта заёмщика.
  • Прогнозирование банкротства компаний.
  • Оценка вероятности покупки товара (маркетинговые модели).

Социология и политология

  • Анализ голосования на выборах (проголосует/не проголосует).
  • Изучение факторов, влияющих на принятие решения (например, о переезде).

Технические системы

  • Диагностика неисправностей: исправен/неисправен.
  • Классификация изображений (например, «кот»/«не кот») в простых бинарных задачах.

Ограничения и критика

  • Предположение о независимости наблюдений — нарушается при повторных измерениях (требуются обобщённые модели, например, GEE).
  • Мультиколлинеарность — приводит к нестабильности оценок.
  • Редкие события — при очень малой доле единиц (например, <1%) стандартный метод максимального правдоподобия может давать смещённые оценки; применяют коррекцию (метод Фирта) или выборку по случаям.
  • Несбалансированные классы — модель может предсказывать только нули; требуются взвешивание или методы oversampling/undersampling.
  • Линейность в логите — предполагается, что предикторы влияют на логарифм шансов линейно; нелинейные эффекты требуют включения квадратичных членов или сплайнов.

Связь с другими методами

Бинарная регрессия является частным случаем обобщённых линейных моделей (GLM) с бинарным распределением. Она также лежит в основе многих методов машинного обучения, таких как градиентный бустинг (с логистической функцией потерь) и нейронные сети (с сигмоидной активацией на выходе). В отличие от деревьев решений и случайных лесов, бинарная регрессия даёт интерпретируемые коэффициенты, но требует строгих предположений о форме связи.

Программная реализация

В статистических пакетах и языках программирования бинарная регрессия реализована:

  • R: функции glm() (с аргументом family = binomial), пакеты logistf (для редких событий), brglm.
  • Python: statsmodels.Logit, sklearn.linear_model.LogisticRegression.
  • Stata: команды logit, probit.
  • SAS: процедура LOGISTIC.

Источники

  1. Hosmer D.W., Lemeshow S., Sturdivant R.X. Applied Logistic Regression. — 3rd ed. — Wiley, 2013.
  2. Greene W.H. Econometric Analysis. — 8th ed. — Pearson, 2018.
  3. McCullagh P., Nelder J.A. Generalized Linear Models. — 2nd ed. — Chapman & Hall, 1989.
  4. Long J.S. Regression Models for Categorical and Limited Dependent Variables. — Sage, 1997.
  5. Agresti A. Categorical Data Analysis. — 3rd ed. — Wiley, 2013.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →