Открыть сервис

Робастные стандартные ошибки

Робастные стандартные ошибки (также стандартные ошибки в форме Уайта, сэндвич-оценка дисперсии, состоятельные стандартные ошибки при гетероскедастичности) — это метод оценки дисперсии и ковариационной матрицы параметров регрессионной модели, который остаётся состоятельным (то есть даёт верные асимптотические выводы) при нарушении классического предположения о гомоскедастичности ошибок (постоянстве дисперсии случайной составляющей). В отличие от стандартных ошибок, вычисляемых по формуле Гаусса — Маркова, робастные стандартные ошибки не требуют, чтобы дисперсия ошибок была одинаковой для всех наблюдений, что делает их незаменимым инструментом в эмпирических исследованиях, особенно в экономике, социологии и эпидемиологии.

История

Идея робастной оценки дисперсии возникла в контексте критики классической линейной регрессии, которая чувствительна к гетероскедастичности. В 1967 году Хьюберт Уайт, работавший в то время в Массачусетском технологическом институте, предложил общий подход к оценке ковариационной матрицы, основанный на «сэндвич-формуле». Его работа 1980 года «A Heteroskedasticity-Consistent Covariance Matrix Estimator and a Direct Test for Heteroskedasticity» (в русском переводе — «Оценка ковариационной матрицы, состоятельная при гетероскедастичности, и прямой тест на гетероскедастичность») стала основополагающей. Уайт показал, что при определённых условиях регулярности (конечные моменты, независимость наблюдений) оценка дисперсии, построенная с использованием квадратов остатков, является состоятельной, даже если истинная дисперсия ошибок неизвестна и непостоянна.

Позднее метод был обобщён для случая автокоррелированных ошибок (оценки Ньюи — Уэста, 1987) и для кластерных данных (оценки, учитывающие внутригрупповую корреляцию, например, в работах Лянга и Зегера, 1986). В современной эконометрике робастные стандартные ошибки стали стандартом де-факто: многие эмпирические работы публикуются с обязательным указанием, использовались ли они.

Математическая формулировка

Рассмотрим линейную регрессионную модель:

\[ y_i = x_i' \beta + \varepsilon_i, \quad i = 1, \dots, n, \]

где \(y_i\) — зависимая переменная, \(x_i\) — вектор регрессоров (размерности \(k\)), \(\beta\) — вектор неизвестных коэффициентов, \(\varepsilon_i\) — случайная ошибка. В матричной форме: \(Y = X\beta + \varepsilon\).

Классическая оценка ковариационной матрицы МНК-оценки \(\hat{\beta}\) имеет вид:

\[ \text{Var}(\hat{\beta}) = \sigma^2 (X'X)^{-1}, \]

где \(\sigma^2 = \text{Var}(\varepsilon_i)\) предполагается постоянной. Если гетероскедастичность присутствует, эта оценка становится смещённой и несостоятельной.

Робастная оценка Уайта (HC0) записывается как:

\[ \widehat{\text{Var}}_{\text{HC0}}(\hat{\beta}) = (X'X)^{-1} \left( \sum_{i=1}^n \hat{\varepsilon}_i^2 x_i x_i' \right) (X'X)^{-1}, \]

где \(\hat{\varepsilon}_i = y_i - x_i' \hat{\beta}\) — остатки регрессии. Эта формула называется «сэндвич-оценкой»: «хлеб» — матрица \((X'X)^{-1}\), «начинка» — матрица из квадратов остатков.

Поправки для малых выборок

На практике HC0 может быть смещена вниз при малых объёмах выборки. Для улучшения свойств были предложены модификации:

  • HC1 (поправка на число степеней свободы): замена \(\hat{\varepsilon}_i^2\) на \(\frac{n}{n-k} \hat{\varepsilon}_i^2\).
  • HC2 (поправка на рычаги): \(\hat{\varepsilon}_i^2 / (1 - h_{ii})\), где \(h_{ii}\) — диагональный элемент матрицы проекции \(H = X(X'X)^{-1}X'\).
  • HC3 (поправка Дэвидсона — Маккиннона): \(\hat{\varepsilon}_i^2 / (1 - h_{ii})^2\). Эта версия даёт наименьшее смещение в малых выборках и рекомендована для использования в большинстве эмпирических приложений.
  • HC4 (поправка Крамера — фон Хайека): \(\hat{\varepsilon}_i^2 / (1 - h_{ii})^{\delta_i}\), где \(\delta_i = \min(4, n h_{ii}/k)\).

Виды робастных стандартных ошибок

1. Стандартные ошибки, состоятельные при гетероскедастичности (HC)

Используются, когда ошибки независимы, но имеют разную дисперсию. Основные варианты — HC0–HC4, описанные выше.

2. Стандартные ошибки, состоятельные при гетероскедастичности и автокорреляции (HAC)

Применяются для временных рядов, где ошибки могут быть коррелированы во времени. Наиболее известная оценка — оценка Ньюи — Уэста (1987). Она использует ядерную (сглаживающую) функцию для взвешивания автоковариаций остатков:

\[ \widehat{\text{Var}}_{\text{HAC}}(\hat{\beta}) = (X'X)^{-1} \hat{S} (X'X)^{-1}, \]

где \(\hat{S} = \sum_{j=-m}^{m} K\left(\frac{j}{m}\right) \hat{\Gamma}_j\), \(\hat{\Gamma}_j = \frac{1}{n} \sum_{t=j+1}^n \hat{\varepsilon}_t \hat{\varepsilon}_{t-j} x_t x_{t-j}'\), \(K(\cdot)\) — ядро (например, Бартлетта или Парзена), \(m\) — ширина окна (bandwidth), выбираемая исследователем.

3. Кластерные стандартные ошибки

Используются, когда данные сгруппированы (например, учащиеся по школам, пациенты по больницам, фирмы по отраслям) и ошибки коррелированы внутри кластеров, но независимы между кластерами. Оценка дисперсии модифицируется путём суммирования по кластерам:

\[ \widehat{\text{Var}}_{\text{cluster}}(\hat{\beta}) = (X'X)^{-1} \left( \sum_{c=1}^C X_c' \hat{\varepsilon}_c \hat{\varepsilon}_c' X_c \right) (X'X)^{-1}, \]

где \(C\) — число кластеров, \(X_c\) — матрица регрессоров для кластера \(c\), \(\hat{\varepsilon}_c\) — вектор остатков для кластера \(c\). Для малого числа кластеров (менее 20–30) рекомендуется использовать поправку на конечную выборку (например, умножение на \(\frac{C}{C-1}\)).

Применение

В эконометрике

Робастные стандартные ошибки являются стандартным инструментом в регрессионном анализе. Они используются в большинстве статистических пакетов (Stata, R, Python, SAS, EViews) для оценки значимости коэффициентов, построения доверительных интервалов и тестирования гипотез. В эмпирических работах по экономике, финансам и менеджменту авторы обязаны указывать, какой тип робастных ошибок применялся (HC, HAC, кластерные).

В социологии и эпидемиологии

При анализе данных с иерархической структурой (например, опросы домохозяйств, клинические испытания с многократными измерениями) кластерные стандартные ошибки позволяют корректно учитывать внутригрупповую корреляцию, избегая завышения значимости (ложноположительных выводов).

В машинном обучении

Робастные стандартные ошибки применяются для оценки неопределённости предсказаний в линейных моделях и обобщённых линейных моделях (GLM), особенно когда данные содержат выбросы или гетероскедастичность.

Критика и ограничения

  1. Смещение в малых выборках. Несмотря на поправки (HC2, HC3), робастные ошибки могут быть смещены при очень малых объёмах выборки (менее 50 наблюдений). В таких случаях рекомендуется использовать бутстреп-методы или точные тесты.
  2. Чувствительность к выбросам. Оценка дисперсии, основанная на квадратах остатков, может быть искажена при наличии выбросов. В таких ситуациях применяют робастные регрессионные методы (например, M-оценки).
  3. Необходимость правильной спецификации кластеров. При использовании кластерных ошибок важно правильно определить уровень кластеризации. Ошибка в выборе кластера (например, слишком мелкий или слишком крупный) может привести к неверным выводам.
  4. Асимптотическая обоснованность. Метод Уайта является асимптотическим (требует большого числа наблюдений). В малых выборках его свойства могут быть неудовлетворительными, и предпочтительнее использовать точные методы (например, рандомизационные тесты).

Интересные факты

  • В 2011 году эконометрист Хэлберт Уайт был удостоен премии Неммерса в области экономики за свой вклад в теорию робастного оценивания.
  • В пакете Stata команда regress, robust по умолчанию использует оценку HC1 (с поправкой на число степеней свободы), а в R функция lmtest::coeftest с опцией vcov = vcovHC позволяет выбрать любой из вариантов HC0–HC4.
  • В некоторых областях (например, в психологии и медицине) робастные ошибки долгое время не были стандартом, что приводило к завышенному числу ложных открытий (проблема «публикационного смещения»).

Источники

  • White, H. (1980). A Heteroskedasticity-Consistent Covariance Matrix Estimator and a Direct Test for Heteroskedasticity. Econometrica, 48(4), 817–838.
  • Newey, W. K., & West, K. D. (1987). A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix. Econometrica, 55(3), 703–708.
  • Cameron, A. C., & Miller, D. L. (2015). A Practitioner’s Guide to Cluster-Robust Inference. Journal of Human Resources, 50(2), 317–372.
  • Davidson, R., & MacKinnon, J. G. (1993). Estimation and Inference in Econometrics. Oxford University Press.
  • Long, J. S., & Ervin, L. H. (2000). Using Heteroscedasticity Consistent Standard Errors in the Linear Regression Model. The American Statistician, 54(3), 217–224.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →