Бинарная регрессия
Бинарная регрессия — это раздел статистического моделирования и машинного обучения, предназначенный для предсказания вероятности принадлежности наблюдения к одной из двух взаимоисключающих категорий (бинарный отклик). В отличие от линейной регрессии, которая предсказывает непрерывную величину, бинарная регрессия оценивает вероятность события, принимающего значения 0 или 1 (например, «да»/«нет», «успех»/«неудача», «болен»/«здоров»). Основными методами бинарной регрессии являются логистическая регрессия, пробит-регрессия и регрессия на основе логит-модели.
Математическая постановка задачи
Пусть \( Y \) — зависимая бинарная переменная, принимающая значения 0 или 1. Цель модели — оценить условную вероятность \( P(Y=1 | X) \), где \( X = (x_1, x_2, ..., x_k) \) — вектор независимых переменных (предикторов). В линейной регрессии предполагается, что \( E(Y|X) = X\beta \), но для бинарного отклика это приводит к недопустимым вероятностям (меньше 0 или больше 1). Поэтому бинарная регрессия использует нелинейную функцию связи \( F \), которая преобразует линейную комбинацию предикторов в интервал [0,1]:
\[ P(Y=1 | X) = F(X\beta) \]
где \( \beta \) — вектор коэффициентов, а \( F \) — монотонная функция распределения.
Основные модели
Логистическая регрессия (логит-модель)
Наиболее распространённый метод бинарной регрессии. Функция связи — логистическая функция:
\[ F(z) = \frac{1}{1 + e^{-z}} \]
где \( z = X\beta \). Модель оценивается методом максимального правдоподобия. Коэффициенты интерпретируются через отношение шансов (odds ratio): \( e^{\beta_j} \) показывает, во сколько раз изменяется шанс \( P/(1-P) \) при увеличении \( x_j \) на единицу.
Пробит-регрессия
Использует функцию распределения стандартного нормального закона:
\[ F(z) = \Phi(z) = \int_{-\infty}^{z} \frac{1}{\sqrt{2\pi}} e^{-t^2/2} dt \]
Пробит-модель часто применяется в экономике и биологии, когда предполагается, что бинарный исход возникает из-за скрытой (латентной) непрерывной переменной, превышающей порог.
Другие модели
- Регрессия с дополнительным логарифмом (complementary log-log): \( F(z) = 1 - e^{-e^z} \), используется для асимметричных распределений.
- Модель с линейной вероятностью (LPM): \( P = X\beta \), простая, но даёт вероятности вне [0,1] и гетероскедастичность.
Оценка и интерпретация
Метод максимального правдоподобия
Параметры моделей бинарной регрессии (кроме LPM) оцениваются итеративно (например, методом Ньютона-Рафсона). Функция правдоподобия для выборки из \( n \) наблюдений:
\[ L(\beta) = \prod_{i=1}^{n} [F(X_i\beta)]^{y_i} [1 - F(X_i\beta)]^{1 - y_i} \]
Предельные эффекты
Поскольку модель нелинейна, влияние предиктора на вероятность зависит от значения всех переменных. Предельный эффект для непрерывного предиктора \( x_j \) рассчитывается как:
\[ \frac{\partial P}{\partial x_j} = \beta_j \cdot f(X\beta) \]
где \( f \) — плотность распределения, соответствующая функции связи. Для дискретных предикторов вычисляют изменение вероятности при переходе от 0 к 1.
Качество модели
- Псевдо-R² (Макфаддена, Коула, Нагелькерке) — аналоги коэффициента детерминации, но не имеют прямого смысла доли объяснённой дисперсии.
- Информационные критерии (AIC, BIC) — для сравнения моделей.
- ROC-кривая и AUC — оценка дискриминационной способности: AUC > 0.7 считается приемлемым, > 0.9 — отличным.
- Тест Хосмера-Лемешоу — проверка калибровки модели.
Применение
Бинарная регрессия широко используется в различных областях:
Медицина
- Прогнозирование наличия заболевания (например, диабета) по клиническим показателям.
- Оценка вероятности летального исхода после операции.
Экономика и финансы
- Модели кредитного скоринга: вероятность дефолта заёмщика.
- Прогнозирование банкротства компаний.
- Оценка вероятности покупки товара (маркетинговые модели).
Социология и политология
- Анализ голосования на выборах (проголосует/не проголосует).
- Изучение факторов, влияющих на принятие решения (например, о переезде).
Технические системы
- Диагностика неисправностей: исправен/неисправен.
- Классификация изображений (например, «кот»/«не кот») в простых бинарных задачах.
Ограничения и критика
- Предположение о независимости наблюдений — нарушается при повторных измерениях (требуются обобщённые модели, например, GEE).
- Мультиколлинеарность — приводит к нестабильности оценок.
- Редкие события — при очень малой доле единиц (например, <1%) стандартный метод максимального правдоподобия может давать смещённые оценки; применяют коррекцию (метод Фирта) или выборку по случаям.
- Несбалансированные классы — модель может предсказывать только нули; требуются взвешивание или методы oversampling/undersampling.
- Линейность в логите — предполагается, что предикторы влияют на логарифм шансов линейно; нелинейные эффекты требуют включения квадратичных членов или сплайнов.
Связь с другими методами
Бинарная регрессия является частным случаем обобщённых линейных моделей (GLM) с бинарным распределением. Она также лежит в основе многих методов машинного обучения, таких как градиентный бустинг (с логистической функцией потерь) и нейронные сети (с сигмоидной активацией на выходе). В отличие от деревьев решений и случайных лесов, бинарная регрессия даёт интерпретируемые коэффициенты, но требует строгих предположений о форме связи.
Программная реализация
В статистических пакетах и языках программирования бинарная регрессия реализована:
- R: функции
glm()(с аргументомfamily = binomial), пакетыlogistf(для редких событий),brglm. - Python:
statsmodels.Logit,sklearn.linear_model.LogisticRegression. - Stata: команды
logit,probit. - SAS: процедура
LOGISTIC.
Источники
- Hosmer D.W., Lemeshow S., Sturdivant R.X. Applied Logistic Regression. — 3rd ed. — Wiley, 2013.
- Greene W.H. Econometric Analysis. — 8th ed. — Pearson, 2018.
- McCullagh P., Nelder J.A. Generalized Linear Models. — 2nd ed. — Chapman & Hall, 1989.
- Long J.S. Regression Models for Categorical and Limited Dependent Variables. — Sage, 1997.
- Agresti A. Categorical Data Analysis. — 3rd ed. — Wiley, 2013.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →