Открыть сервис

Взвешенные наименьшие квадраты

Взвешенные наименьшие квадраты (Weighted Least Squares, WLS) — это метод оценивания параметров регрессионной модели, являющийся обобщением метода наименьших квадратов (МНК). Он применяется в ситуациях, когда нарушается одно из ключевых предположений классической линейной регрессии — гомоскедастичность, то есть постоянство дисперсии случайных ошибок. В отличие от обычного МНК, который приписывает всем наблюдениям равный вес, WLS присваивает каждому наблюдению свой вес, обратно пропорциональный дисперсии его ошибки. Это позволяет получить более эффективные и несмещённые оценки параметров модели при наличии гетероскедастичности.

История и развитие

Метод наименьших квадратов был впервые предложен Карлом Фридрихом Гауссом в начале XIX века для обработки астрономических данных. Идея взвешивания наблюдений возникла позже, когда статистики столкнулись с данными, где точность измерений была неодинаковой. Первые упоминания о взвешенных наименьших квадратах относятся к работам Гаусса, где он рассматривал случай, когда дисперсия ошибок известна с точностью до множителя. В XX веке метод получил теоретическое обоснование в рамках теории оценивания и регрессионного анализа. Развитие вычислительной техники во второй половине XX века сделало WLS широко доступным для практического применения в эконометрике, биологии, физике и других науках.

Математическая формулировка

Рассмотрим линейную регрессионную модель:

\[ y_i = \mathbf{x}_i^T \boldsymbol{\beta} + \varepsilon_i, \quad i = 1, \ldots, n, \]

где \( y_i \) — зависимая переменная, \( \mathbf{x}_i \) — вектор-столбец независимых переменных (включая константу), \( \boldsymbol{\beta} \) — вектор неизвестных параметров, \( \varepsilon_i \) — случайная ошибка. В классическом МНК предполагается, что \( \text{Var}(\varepsilon_i) = \sigma^2 \) для всех \( i \). В WLS допускается, что \( \text{Var}(\varepsilon_i) = \sigma^2 / w_i \), где \( w_i > 0 \) — известные веса. Оценка параметров \( \hat{\boldsymbol{\beta}}_{WLS} \) находится путём минимизации взвешенной суммы квадратов остатков:

\[ \min_{\boldsymbol{\beta}} \sum_{i=1}^n w_i (y_i - \mathbf{x}_i^T \boldsymbol{\beta})^2. \]

Решение в матричной форме имеет вид:

\[ \hat{\boldsymbol{\beta}}_{WLS} = (\mathbf{X}^T \mathbf{W} \mathbf{X})^{-1} \mathbf{X}^T \mathbf{W} \mathbf{y}, \]

где \( \mathbf{X} \) — матрица плана размерности \( n \times p \), \( \mathbf{y} \) — вектор наблюдений, \( \mathbf{W} = \text{diag}(w_1, \ldots, w_n) \) — диагональная матрица весов.

Свойства оценок

При условии, что веса выбраны правильно (то есть обратно пропорциональны дисперсиям ошибок), оценки WLS являются:

  • Несмещёнными: \( \mathbb{E}[\hat{\boldsymbol{\beta}}_{WLS}] = \boldsymbol{\beta} \).
  • Эффективными среди всех линейных несмещённых оценок (теорема Гаусса — Маркова для взвешенного случая): их ковариационная матрица минимальна.
  • Состоятельными: при увеличении объёма выборки оценки сходятся к истинным значениям параметров.

Ковариационная матрица оценок WLS оценивается как:

\[ \widehat{\text{Var}}(\hat{\boldsymbol{\beta}}_{WLS}) = \hat{\sigma}^2 (\mathbf{X}^T \mathbf{W} \mathbf{X})^{-1}, \]

где \( \hat{\sigma}^2 = \frac{1}{n-p} \sum_{i=1}^n w_i (y_i - \mathbf{x}_i^T \hat{\boldsymbol{\beta}}_{WLS})^2 \).

Выбор весов

Практическая реализация WLS требует знания весов \( w_i \). В реальных задачах дисперсии ошибок обычно неизвестны, поэтому веса приходится оценивать. Существует несколько подходов:

Априорные веса

Если дисперсия ошибки пропорциональна некоторой известной величине (например, \( \text{Var}(\varepsilon_i) \propto x_i \)), то веса задаются как \( w_i = 1 / x_i \). Это характерно для данных, где точность измерений зависит от уровня переменной (например, в экономических данных с разными объёмами продаж).

Оценка на основе группировки

Если данные можно разбить на группы с примерно одинаковой дисперсией внутри каждой группы, то веса рассчитываются как обратные выборочным дисперсиям остатков внутри групп. Этот метод часто применяется в анализе дисперсий.

Итеративная процедура (Feasible WLS)

На первом шаге оценивается обычный МНК, затем по остаткам \( e_i \) строится модель для дисперсии: \( \ln(e_i^2) = \mathbf{z}_i^T \boldsymbol{\gamma} + \nu_i \). После оценки параметров \( \boldsymbol{\gamma} \) вычисляются прогнозные дисперсии \( \hat{\sigma}_i^2 \), и веса задаются как \( w_i = 1 / \hat{\sigma}_i^2 \). Затем WLS применяется заново. Процедура может повторяться до сходимости.

Применение

Эконометрика

WLS широко используется в эконометрике для анализа данных с гетероскедастичностью, например, при изучении доходов домохозяйств (дисперсия доходов растёт с их уровнем) или при анализе панельных данных. В России метод применяется в исследованиях по региональной экономике, где дисперсия ошибок может зависеть от размера региона.

Биология и медицина

В биостатистике WLS используется для анализа дозозависимых эффектов, где точность измерений может различаться в зависимости от дозы. Например, при оценке зависимости смертности от концентрации токсина.

Физика и инженерия

В экспериментальной физике WLS применяется для обработки данных с разной точностью измерений. Например, при калибровке приборов, где погрешность каждого измерения известна заранее.

Геостатистика

В геостатистике WLS используется для моделирования пространственных данных, где дисперсия ошибок может зависеть от расстояния между точками наблюдения.

Сравнение с другими методами

Обычный МНК (OLS)

OLS является частным случаем WLS при \( w_i = 1 \) для всех \( i \). При гетероскедастичности OLS даёт несмещённые, но неэффективные оценки, а стандартные ошибки оказываются смещёнными, что приводит к некорректным выводам в тестах гипотез.

Обобщённый метод наименьших квадратов (GLS)

WLS является частным случаем GLS, когда ковариационная матрица ошибок диагональна, но не пропорциональна единичной матрице. GLS допускает корреляцию между ошибками, что делает его более общим, но и более сложным в реализации.

Робастные методы

Робастные методы (например, метод наименьших модулей) устойчивы к выбросам, но не обязательно эффективны при гетероскедастичности. WLS, напротив, требует точного задания весов и уязвим к их неправильному выбору.

Ограничения и критика

  • Точность весов: Неправильный выбор весов может привести к смещению оценок и неверным выводам. Оценка весов по данным (Feasible WLS) вносит дополнительную неопределённость.
  • Чувствительность к выбросам: Наблюдения с малыми весами (то есть с большой дисперсией) могут быть выбросами, что искажает результаты.
  • Предположение о независимости ошибок: WLS, как и OLS, предполагает, что ошибки независимы. Нарушение этого условия требует использования GLS.
  • Сложность интерпретации: Взвешенные остатки не имеют прямой содержательной интерпретации, что затрудняет анализ модели.

Интересные факты

  • В российских учебниках по эконометрике (например, под редакцией С. А. Айвазяна) WLS часто рассматривается как часть темы «Гетероскедастичность», а в качестве примера приводится анализ зависимости расходов на питание от дохода.
  • Метод WLS лежит в основе многих статистических пакетов, включая R (функция lm с аргументом weights), Python (statsmodels) и Stata (команда regress с опцией [aw=weight]).
  • В некоторых приложениях, например, в анализе временных рядов с изменяющейся волатильностью, WLS используется как простой способ учёта гетероскедастичности без перехода к GARCH-моделям.

Источники

  • Айвазян С. А., Мхитарян В. С. Прикладная статистика и основы эконометрики. — М.: ЮНИТИ, 1998.
  • Магнус Я. Р., Катышев П. К., Пересецкий А. А. Эконометрика. Начальный курс. — М.: Дело, 2007.
  • Greene W. H. Econometric Analysis. — 8th ed. — Pearson, 2018.
  • Draper N. R., Smith H. Applied Regression Analysis. — 3rd ed. — Wiley, 1998.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →