Открыть сервис

Пробит-модель

Пробит-модель — это разновидность регрессионной модели, используемой в статистике и эконометрике для анализа бинарных зависимых переменных. В отличие от линейной регрессии, пробит-модель оценивает вероятность того, что зависимая переменная примет значение 1 (или «успех»), при заданных значениях независимых переменных. Название происходит от англ. probability unit (вероятностная единица). Модель основана на предположении, что вероятность наступления события описывается функцией стандартного нормального распределения.

История

Пробит-модель была впервые предложена в 1934 году американским биологом Честером Блиссом (Chester Ittner Bliss) в контексте анализа токсикологических экспериментов. Блисс изучал зависимость смертности насекомых от дозы инсектицида и обнаружил, что связь между логарифмом дозы и процентом погибших особей хорошо описывается кумулятивной функцией нормального распределения. Он ввёл термин «пробит» как сокращение от «probability unit» (вероятностная единица). В 1950-х годах модель была формализована в эконометрике Дэвидом Коксом и другими исследователями как альтернатива логит-модели. В СССР и России пробит-модели начали активно применяться в экономике и социологии с 1990-х годов, после распространения пакетов статистического анализа.

Математическая формулировка

Пусть \( Y \) — бинарная зависимая переменная, принимающая значения 0 или 1. Пробит-модель предполагает, что существует латентная (ненаблюдаемая) переменная \( Y^* \), которая линейно зависит от набора независимых переменных \( X_1, X_2, \dots, X_k \):

\[ Y^* = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \dots + \beta_k X_k + \varepsilon, \]

где \( \varepsilon \) — случайная ошибка, распределённая по стандартному нормальному закону с математическим ожиданием 0 и дисперсией 1. Наблюдаемая переменная \( Y \) определяется правилом:

\[ Y = \begin{cases} 1, & \text{если } Y^ > 0, \\ 0, & \text{если } Y^ \leq 0. \end{cases} \]

Тогда вероятность того, что \( Y = 1 \), равна:

\[ P(Y = 1 \mid X_1, \dots, X_k) = \Phi(\beta_0 + \beta_1 X_1 + \dots + \beta_k X_k), \]

где \( \Phi \) — функция стандартного нормального распределения (кумулятивная функция распределения). Оценка параметров \( \beta_0, \beta_1, \dots, \beta_k \) производится методом максимального правдоподобия.

Сравнение с другими моделями

Пробит-модель является одной из нескольких моделей для бинарного выбора. Наиболее распространённые альтернативы:

  • Логит-модель — использует логистическое распределение вместо нормального. Различия между пробит- и логит-моделями в основном проявляются в хвостах распределения: логит-модель даёт более тяжёлые хвосты, что означает более медленное приближение вероятностей к 0 или 1. На практике обе модели часто дают схожие результаты, и выбор между ними определяется традицией в конкретной области или удобством интерпретации (логит-модель позволяет вычислять отношения шансов).
  • Линейная вероятностная модель — простая линейная регрессия, где \( Y \) регрессируется на \( X \). Её недостатки: предсказанные вероятности могут выходить за пределы [0, 1], а ошибки гетероскедастичны. Пробит-модель лишена этих проблем.
  • Модель с дополнительным параметром (например, гомпит-модель) — используется редко и основана на распределении экстремальных значений.

Оценка параметров и интерпретация

Параметры пробит-модели оцениваются методом максимального правдоподобия, который итеративно подбирает коэффициенты, максимизирующие вероятность наблюдения имеющихся данных. В отличие от линейной регрессии, коэффициенты \( \beta \) не интерпретируются как изменение \( Y \) при изменении \( X \) на единицу. Вместо этого они показывают изменение латентной переменной \( Y^* \). Для интерпретации влияния независимых переменных на вероятность \( P(Y=1) \) вычисляют предельные эффекты:

\[ \frac{\partial P(Y=1)}{\partial X_j} = \beta_j \cdot \phi(\beta_0 + \beta_1 X_1 + \dots + \beta_k X_k), \]

где \( \phi \) — плотность стандартного нормального распределения. Предельный эффект зависит от всех значений \( X \), поэтому его часто вычисляют при средних значениях переменных или для типичных наблюдений.

Применение

Пробит-модели широко используются в различных областях, где требуется предсказать бинарный исход:

  • Экономика и финансы: анализ кредитного риска (вероятность дефолта заёмщика), моделирование выбора потребителя (купить/не купить), оценка эффективности маркетинговых кампаний (отклик на рекламу).
  • Медицина и эпидемиология: определение вероятности заболевания (например, инфаркта) в зависимости от факторов риска (возраст, курение, давление). В токсикологии — оценка летальной дозы (LD50) по данным о смертности.
  • Социология и политология: анализ голосования на выборах (проголосовал/не проголосовал), изучение общественного мнения (поддерживает/не поддерживает политику).
  • Криминология: прогнозирование рецидивизма (совершил повторное преступление/не совершил).
  • Биология: анализ выживаемости организмов при различных условиях.

Пример

Предположим, изучается вероятность того, что студент сдаст экзамен (\( Y=1 \)) в зависимости от количества часов подготовки (\( X \)) и среднего балла за семестр (\( Z \)). Пробит-модель может иметь вид:

\[ P(Y=1) = \Phi(-2.5 + 0.3 \cdot X + 0.8 \cdot Z). \]

Если студент занимался 10 часов при среднем балле 4.0, то линейный индекс равен \(-2.5 + 0.3 \cdot 10 + 0.8 \cdot 4.0 = -2.5 + 3.0 + 3.2 = 3.7\). Вероятность сдачи равна \( \Phi(3.7) \approx 0.9999 \). При нулевых часах и среднем балле 2.0 индекс равен \(-2.5 + 0 + 1.6 = -0.9\), вероятность \( \Phi(-0.9) \approx 0.184 \). Предельный эффект часов подготовки при средних значениях переменных составит \( 0.3 \cdot \phi(\text{средний индекс}) \), что даёт изменение вероятности примерно на 0.12 при увеличении подготовки на один час.

Ограничения и критика

  • Предположение о нормальности ошибок: в реальных данных ошибки могут не следовать нормальному распределению, что приводит к смещённым оценкам.
  • Необходимость больших выборок: для надёжной оценки параметров требуется не менее нескольких сотен наблюдений, особенно при малом количестве событий (редких исходах).
  • Мультиколлинеарность: как и в линейной регрессии, сильная корреляция между независимыми переменными затрудняет оценку.
  • Интерпретация: коэффициенты не имеют прямого интуитивного смысла, что усложняет объяснение результатов неспециалистам.
  • Гетероскедастичность: в отличие от логит-модели, пробит-модель менее устойчива к нарушению гомоскедастичности.

Реализация в программном обеспечении

Пробит-модели реализованы во всех основных статистических пакетах и языках программирования:

  • R: функция glm() с аргументом family = binomial(link = "probit").
  • Python: класс Probit из модуля statsmodels.discrete или sm.Probit.
  • Stata: команда probit.
  • SPSS: процедура PROBIT.
  • MATLAB: функция glmfit с указанием распределения binomial и связи probit.

Интересные факты

  • В токсикологии пробит-анализ используется для оценки полулетальной дозы (LD50), при которой погибает 50 % особей. Для этого пробит-значение, равное 5, соответствует вероятности 0.5 (поскольку \( \Phi^{-1}(0.5) = 0 \), а в классической шкале Блисса пробит = 5 + \( \Phi^{-1}(p) \)).
  • Пробит-модель является частным случаем обобщённой линейной модели (GLM) с пробит-функцией связи.
  • В некоторых областях, например в психометрике, пробит-модель используется для анализа дихотомических ответов на тестовые задания (модель Раша — вариант пробит-модели).

Источники

  • Bliss, C. I. (1934). «The Method of Probits». Science, 79(2037), 38–39.
  • Greene, W. H. (2018). Econometric Analysis (8th ed.). Pearson.
  • Wooldridge, J. M. (2010). Econometric Analysis of Cross Section and Panel Data (2nd ed.). MIT Press.
  • Магнус, Я. Р., Катышев, П. К., Пересецкий, А. А. (2007). Эконометрика. Начальный курс (8-е изд.). Дело.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →