Открыть сервис

Пробит-анализ

Пробит-анализ — это метод статистического моделирования, используемый для анализа бинарных или дихотомических зависимых переменных, когда результат представляет собой выбор из двух альтернатив (например, «да/нет», «успех/неудача», «жив/мёртв»). В отличие от линейной регрессии, которая предполагает непрерывную зависимую переменную, пробит-анализ основан на предположении, что вероятность наступления события связана с набором независимых переменных через кумулятивную функцию стандартного нормального распределения. Метод широко применяется в экономике, биологии, медицине, социологии и других областях для прогнозирования вероятностей и оценки влияния факторов на бинарный исход.

История

Пробит-анализ был разработан в начале XX века в контексте биологических и токсикологических исследований. Термин «пробит» (от англ. probability unit — вероятностная единица) ввёл американский статистик Честер Ирвин Блисс в 1934 году. Блисс работал в области энтомологии и изучал зависимость смертности насекомых от дозы инсектицида. Он предложил преобразовывать проценты смертности в единицы нормального распределения, чтобы линеаризовать кривую «доза-эффект». В 1935 году Рональд Фишер усовершенствовал метод, предложив процедуру оценки максимального правдоподобия для пробит-модели.

В 1940-х годах пробит-анализ начал применяться в экономике, особенно в исследованиях потребительского выбора и рынков труда. В 1970-х годах, с развитием вычислительной техники, метод стал широко доступен для практического использования в пакетах статистического программного обеспечения. В современной науке пробит-анализ является одним из стандартных инструментов анализа бинарных данных, наряду с логистической регрессией.

Математическая основа

Модель пробит-анализа

Пробит-модель предполагает, что существует скрытая (латентная) переменная \( Y^* \), которая линейно зависит от набора независимых переменных \( X \) и случайной ошибки \( \varepsilon \):

\[ Y^* = X\beta + \varepsilon \]

где \( \beta \) — вектор коэффициентов, а \( \varepsilon \) — случайная ошибка, распределённая по стандартному нормальному закону с нулевым средним и единичной дисперсией \( \varepsilon \sim N(0, 1) \). Наблюдаемая бинарная переменная \( Y \) принимает значение 1, если \( Y^* > 0 \), и 0 в противном случае.

Вероятность того, что \( Y = 1 \) при заданных значениях \( X \) равна:

\[ P(Y = 1 | X) = P(Y^* > 0 | X) = P(X\beta + \varepsilon > 0) = P(\varepsilon > -X\beta) = \Phi(X\beta) \]

где \( \Phi \) — кумулятивная функция стандартного нормального распределения. Таким образом, вероятность успеха выражается через интеграл нормального распределения.

Оценка параметров

Параметры модели \( \beta \) оцениваются методом максимального правдоподобия (ММП). Функция правдоподобия для выборки из \( n \) наблюдений имеет вид:

\[ L(\beta) = \prod_{i=1}^{n} [\Phi(X_i\beta)]^{Y_i} [1 - \Phi(X_i\beta)]^{1 - Y_i} \]

Логарифмическая функция правдоподобия максимизируется численными методами, например, методом Ньютона-Рафсона или градиентным спуском. Оценки ММП являются состоятельными, асимптотически нормальными и эффективными при выполнении стандартных предположений.

Интерпретация коэффициентов

Коэффициенты пробит-модели не имеют прямой интерпретации как изменения вероятности, поскольку они отражают влияние на латентную переменную \( Y^* \). Для интерпретации обычно вычисляют предельные эффекты — изменение вероятности \( P(Y=1) \) при изменении одной независимой переменной на единицу при фиксированных значениях остальных:

\[ \frac{\partial P(Y=1 | X)}{\partial X_j} = \phi(X\beta) \beta_j \]

где \( \phi \) — функция плотности стандартного нормального распределения. Предельные эффекты зависят от значений всех переменных, поэтому их часто вычисляют при средних значениях или для каждого наблюдения.

Сравнение с логистической регрессией

Пробит-анализ и логистическая регрессия являются альтернативными методами анализа бинарных данных. Основное различие заключается в выборе функции связи: в пробит-модели используется кумулятивная функция нормального распределения, а в логистической — логистическая функция. На практике результаты обеих моделей часто близки, особенно при вероятностях, удалённых от крайних значений (0 и 1). Различия становятся заметными при анализе крайних значений или при малых выборках.

Логистическая регрессия более популярна в социальных науках и эпидемиологии из-за простоты интерпретации коэффициентов через отношение шансов (odds ratio). Пробит-анализ чаще используется в экономике и биологии, где теоретические соображения предполагают нормальное распределение ошибок. С математической точки зрения, пробит-модель более обоснована, если латентная переменная действительно имеет нормальное распределение, например, в задачах токсикологии.

Применение

Токсикология и биология

Пробит-анализ исторически возник в токсикологии для оценки зависимости между дозой вещества и вероятностью летального исхода. Модель позволяет оценить полулетальную дозу (LD50) — дозу, при которой погибает 50% испытуемых организмов. Для этого строится пробит-регрессия логарифма дозы на пробит-преобразованные проценты смертности.

Экономика и финансы

В экономике пробит-анализ применяется для моделирования бинарных решений, таких как:

  • участие в рынке труда (работает/не работает);
  • принятие кредитного решения (дефолт/отсутствие дефолта);
  • выбор потребителя (купить/не купить товар);
  • принятие решения о банкротстве.

Пробит-модели используются в кредитном скоринге для оценки вероятности дефолта заёмщика на основе его характеристик (доход, возраст, кредитная история).

Медицина и эпидемиология

В медицинских исследованиях пробит-анализ применяется для анализа исходов лечения (выжил/умер, выздоровел/не выздоровел) в зависимости от дозировки лекарства, возраста пациента или других факторов. Модель также используется в фармакокинетике для оценки эффективности препаратов.

Социология и психология

В социологии пробит-анализ применяется для изучения бинарных установок и поведения: голосование за кандидата, участие в выборах, наличие определённого мнения. В психологии — для анализа результатов тестов, где ответы кодируются как «правильно/неправильно».

Пример

Рассмотрим задачу прогнозирования вероятности дефолта по кредиту на основе двух переменных: дохода заёмщика (в тысячах рублей) и возраста (в годах). Пусть модель пробит-анализа дала следующие коэффициенты: константа = -2,5, коэффициент дохода = 0,05, коэффициент возраста = 0,02. Для заёмщика с доходом 50 тыс. руб. и возрастом 30 лет:

\[ X\beta = -2,5 + 0,05 \times 50 + 0,02 \times 30 = -2,5 + 2,5 + 0,6 = 0,6 \]

Вероятность дефолта: \( P = \Phi(0,6) \approx 0,7257 \), то есть около 72,6%. Предельный эффект дохода: \( \phi(0,6) \times 0,05 \approx 0,3332 \times 0,05 = 0,0167 \), то есть увеличение дохода на 1 тыс. руб. снижает вероятность дефолта примерно на 1,67 процентных пункта.

Критика и ограничения

Пробит-анализ имеет ряд ограничений. Во-первых, модель предполагает линейное влияние независимых переменных на латентную переменную, что может не соответствовать реальности. Во-вторых, ошибки должны быть гомоскедастичными и независимыми. В-третьих, пробит-модель чувствительна к мультиколлинеарности и выбросам. При малых выборках или редких событиях оценки могут быть смещёнными. Кроме того, интерпретация коэффициентов менее интуитивна по сравнению с логистической регрессией.

Программная реализация

Пробит-анализ реализован во многих статистических пакетах, включая:

  • R: функция glm() с аргументом family = binomial(link = "probit") или пакет MASS (функция polr для порядковых моделей);
  • Python: библиотека statsmodels (функция Probit из модуля discrete_choice_model);
  • STATA: команда probit;
  • SPSS: модуль «Бинарная логистическая регрессия» с выбором пробит-связи;
  • MATLAB: функция glmfit с опцией link = 'probit'.

Источники

  • Блисс, Ч. И. (1934). «Метод пробит-анализа». Annals of Applied Biology.
  • Фишер, Р. А. (1935). «Статистические методы для исследователей». Оливер и Бойд.
  • Грин, У. Х. (2012). Эконометрический анализ. 7-е изд. Пирсон.
  • Агрести, А. (2013). Категориальный анализ данных. 3-е изд. Уайли.
  • Хасти, Т., Тибширани, Р., Фридман, Дж. (2009). Элементы статистического обучения. 2-е изд. Спрингер.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →