Открыть сервис

Тобит-модель

Тобит-модель (также тобит-регрессия, цензурированная регрессионная модель) — это эконометрическая модель, предназначенная для анализа зависимостей, в которых зависимая переменная принимает значения только в определённом диапазоне, причём часть наблюдений сосредоточена на границе этого диапазона (чаще всего на нуле). Модель была предложена американским экономистом Джеймсом Тобином в 1958 году и является обобщением классической линейной регрессии для случая цензурированных данных.

История возникновения

Джеймс Тобин (James Tobin, 1918–2002) — лауреат Нобелевской премии по экономике 1981 года — разработал тобит-модель для анализа расходов домохозяйств на товары длительного пользования. В исходной работе «Estimation of Relationships for Limited Dependent Variables» (1958) он исследовал зависимость расходов на автомобили от дохода и других факторов. Проблема заключалась в том, что значительная часть домохозяйств не тратила ничего (нулевые расходы), а для остальных расходы были положительными. Обычная линейная регрессия в таких условиях даёт смещённые и несостоятельные оценки. Тобин предложил использовать модель, в которой латентная (ненаблюдаемая) переменная линейно зависит от регрессоров, а наблюдаемая переменная равна латентной, если она превышает порог (обычно ноль), и равна порогу в противном случае.

Название «тобит-модель» (tobit model) было предложено Артуром Голдбергером (Arthur Goldberger) как сокращение от «Tobin’s probit» — по аналогии с пробит-моделью, но с учётом того, что Тобин использовал нормальное распределение ошибок.

Определение и формальная запись

Тобит-модель в классическом виде (модель Тобина I) задаётся следующим образом. Пусть \( y_i^* \) — латентная (ненаблюдаемая) переменная, которая линейно зависит от вектора объясняющих переменных \( x_i \) и случайной ошибки \( \varepsilon_i \):

\[ y_i^* = x_i^T \beta + \varepsilon_i, \quad \varepsilon_i \sim N(0, \sigma^2), \]

где \( \beta \) — вектор коэффициентов, \( \sigma^2 \) — дисперсия ошибки. Наблюдаемая переменная \( y_i \) определяется по правилу:

\[ y_i = \begin{cases} y_i^, & \text{если } y_i^ > c, \\ c, & \text{если } y_i^* \leq c, \end{cases} \]

где \( c \) — порог цензурирования (чаще всего \( c = 0 \)). Таким образом, все значения латентной переменной ниже порога «схлопываются» в точку \( c \). В случае, когда цензурирование происходит и сверху, и снизу, говорят о двусторонней тобит-модели.

Классификация и разновидности

Тобит-модели делятся на несколько типов в зависимости от характера цензурирования и структуры данных:

Модель Тобина I (стандартная тобит-модель)

Описанная выше модель с одним порогом (обычно нулевым). Применяется, когда зависимая переменная может быть равна нулю или принимать положительные значения, но не может быть отрицательной.

Модель Тобина II (модель с отбором, хекс-модель)

В этой модели процесс генерации данных состоит из двух этапов: сначала бинарное уравнение отбора (участвует ли наблюдение в выборке), затем уравнение регрессии для тех наблюдений, которые прошли отбор. Пример: анализ заработной платы — сначала решается, работает ли человек (отбор), затем — какова его зарплата. Эта модель часто называется «моделью Хекмана» (по имени Джеймса Хекмана, нобелевского лауреата 2000 года).

Модель Тобина III и выше

Более сложные варианты, включающие несколько уравнений отбора и регрессии. На практике чаще всего используются модели I и II типа.

Цензурированная регрессия с произвольным порогом

Обобщение, где порог цензурирования может быть не только нулевым, но и любым другим числом, известным или неизвестным.

Метод оценивания

Оценка параметров тобит-модели производится методом максимального правдоподобия (ММП). Функция правдоподобия для выборки из \( n \) наблюдений строится с учётом двух типов наблюдений:

  • Для наблюдений, где \( y_i = c \) (цензурированные), вклад в правдоподобие — вероятность того, что латентная переменная меньше или равна порогу: \( P(y_i^* \leq c) = \Phi\left( \frac{c - x_i^T \beta}{\sigma} \right) \), где \( \Phi \) — функция стандартного нормального распределения.
  • Для наблюдений, где \( y_i > c \) (нецензурированные), вклад — плотность нормального распределения: \( \frac{1}{\sigma} \phi\left( \frac{y_i - x_i^T \beta}{\sigma} \right) \), где \( \phi \) — плотность стандартного нормального распределения.

Логарифмическая функция правдоподобия максимизируется численно (например, методом Ньютона — Рафсона). Оценки ММП состоятельны и асимптотически эффективны при условии правильной спецификации модели.

Интерпретация коэффициентов

В тобит-модели коэффициенты \( \beta \) интерпретируются иначе, чем в обычной линейной регрессии. Они показывают влияние регрессоров на латентную переменную \( y_i^* \), а не на наблюдаемую \( y_i \). Для практической интерпретации часто рассчитывают:

  • Предельные эффекты на математическое ожидание латентной переменной: \( \partial E[y_i^* | x_i] / \partial x_{ik} = \beta_k \).
  • Предельные эффекты на математическое ожидание наблюдаемой переменной (с учётом цензурирования): \( \partial E[y_i | x_i] / \partial x_{ik} = \beta_k \cdot \Phi\left( \frac{x_i^T \beta}{\sigma} \right) \). Этот эффект меньше \( \beta_k \) по модулю, так как часть наблюдений «застряла» на пороге.
  • Предельные эффекты на вероятность нецензурированного наблюдения: \( \partial P(y_i > c | x_i) / \partial x_{ik} = \beta_k \cdot \phi\left( \frac{x_i^T \beta}{\sigma} \right) / \sigma \).

Для расчёта этих эффектов обычно используются средние по выборке значения регрессоров или медианные значения.

Применение

Тобит-модель широко используется в экономике, социологии, медицине, экологии и других областях, где встречаются цензурированные данные.

Экономика

  • Анализ расходов: расходы на товары длительного пользования (автомобили, бытовая техника), где нулевые расходы означают отсутствие покупки.
  • Рынок труда: анализ продолжительности безработицы (нулевые значения — сразу трудоустроились), заработной платы (нулевая зарплата для неработающих).
  • Финансы: объём торгов акциями (нулевые объёмы в дни без торгов), сумма кредита (нулевая сумма — отказ в кредите).

Социология и демография

  • Количество детей в семье: нулевое значение — бездетные семьи.
  • Время, затрачиваемое на домашнюю работу: нулевое значение — не занимаются домашним хозяйством.

Медицина и эпидемиология

  • Доза лекарства: нулевая доза — пациент не принимал препарат.
  • Продолжительность госпитализации: нулевое значение — не госпитализирован.

Экология

  • Концентрация загрязнителей: нулевые значения — ниже предела обнаружения приборов (цензурирование слева).
  • Улов рыбы: нулевой улов — рыба не поймана.

Ограничения и критика

Несмотря на широкое применение, тобит-модель имеет ряд ограничений:

  • Предположение о нормальности ошибок: если истинное распределение ошибок существенно отличается от нормального, оценки ММП могут быть смещёнными. Для проверки используются тесты на нормальность (например, тест Д'Агостино).
  • Гомоскедастичность: модель предполагает постоянную дисперсию ошибок. Гетероскедастичность приводит к несостоятельности оценок.
  • Линейность: модель предполагает линейную зависимость латентной переменной от регрессоров. В реальности зависимость может быть нелинейной.
  • Чувствительность к спецификации: неправильный выбор порога цензурирования или формы уравнения отбора (в модели Тобина II) может сильно исказить результаты.
  • Альтернативные модели: в некоторых случаях более адекватными могут быть модели с усечением (усечённая регрессия), модели с нулевым надуванием (zero-inflated models) или полупараметрические методы, не требующие нормальности.

Связь с другими моделями

Тобит-модель является частным случаем более общего класса моделей с ограниченной зависимой переменной. К ним относятся:

  • Пробит-модель — для бинарной зависимой переменной.
  • Логит-модель — для бинарной зависимой переменной с логистическим распределением ошибок.
  • Усечённая регрессия — когда наблюдения с нулевыми значениями полностью исключаются из выборки, а не цензурируются.
  • Модель Хекмана (двухшаговая процедура) — для коррекции смещения отбора, часто используется как альтернатива тобит-модели II.

Интересные факты

  • Джеймс Тобин получил Нобелевскую премию не за тобит-модель, а за «анализ финансовых рынков и их влияния на политику расходов, занятости, производства и цен». Однако тобит-модель стала одним из его самых цитируемых вкладов в эконометрику.
  • Название «тобит» было предложено Артуром Голдбергером в шутку, но прижилось в научной литературе.
  • В 2010-е годы с развитием машинного обучения появились непараметрические и полупараметрические аналоги тобит-модели (например, тобит-лес, тобит-нейронные сети), которые ослабляют предположения о нормальности и линейности.

Источники

  • Tobin, J. (1958). Estimation of Relationships for Limited Dependent Variables. Econometrica, 26(1), 24–36.
  • Amemiya, T. (1984). Tobit Models: A Survey. Journal of Econometrics, 24(1–2), 3–61.
  • Greene, W. H. (2018). Econometric Analysis (8th ed.). Pearson.
  • Wooldridge, J. M. (2010). Econometric Analysis of Cross Section and Panel Data (2nd ed.). MIT Press.
  • Cameron, A. C., & Trivedi, P. K. (2005). Microeconometrics: Methods and Applications. Cambridge University Press.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →