Открыть сервис

L-оценка

L-оценка — это робастная статистическая оценка, которая вычисляется как линейная комбинация порядковых статистик (то есть элементов выборки, упорядоченных по возрастанию). L-оценки являются одним из основных классов робастных оценок наряду с M-оценками (оценками максимального правдоподобия) и R-оценками (ранговыми оценками). Они обладают повышенной устойчивостью к выбросам и отклонениям от нормального распределения, сохраняя при этом высокую эффективность для широкого класса распределений. Термин «L-оценка» происходит от английского «linear» (линейный) и указывает на линейную форму зависимости от порядковых статистик.

Определение и общая формула

Пусть \(X_1, X_2, \dots, X_n\) — независимая выборка объёма \(n\) из некоторого распределения. Обозначим \(X_{(1)} \le X_{(2)} \le \dots \le X_{(n)}\) — упорядоченную выборку (порядковые статистики). Тогда L-оценка \(L\) параметра \(\theta\) (например, центра распределения) определяется как:

\[ L = \sum_{i=1}^{n} w_i X_{(i)}, \]

где \(w_i\) — весовые коэффициенты, удовлетворяющие условию \(\sum_{i=1}^{n} w_i = 1\) (для несмещённости оценки центра). Веса могут быть как постоянными (заданными аналитически), так и зависеть от \(n\) и типа распределения.

История

Идея использования линейных комбинаций порядковых статистик восходит к работам по теории порядковых статистик, начатым в 1940-х годах. В 1960-х годах концепция L-оценок была формализована в рамках развития робастной статистики, прежде всего в работах Питера Хьюбера и Фрэнка Хэмпеля. В 1970-х годах L-оценки получили широкое распространение благодаря их простоте и хорошим робастным свойствам. В 1980-х годах были разработаны асимптотические теории для L-оценок, включая их состоятельность и асимптотическую нормальность.

Классификация L-оценок

L-оценки можно классифицировать по нескольким признакам:

По типу весовой функции

  1. Усечённые (trimmed) L-оценки — веса для крайних порядковых статистик равны нулю, а для центральных — одинаковы. Пример: усечённое среднее.
  2. Винзоризованные (Winsorized) L-оценки — крайние значения заменяются на ближайшие к ним значения из выборки, после чего вычисляется обычное среднее.
  3. Оценки с гладкими весами — веса задаются непрерывной функцией от порядкового номера, например, ядерной функцией.

По оцениваемому параметру

  1. Оценки центра (например, медиана, усечённое среднее, оценка Ходжеса-Лемана).
  2. Оценки масштаба (например, межквартильный размах, медианное абсолютное отклонение).
  3. Оценки формы (например, асимметрии и эксцесса).

Примеры конкретных L-оценок

Усечённое среднее

Усечённое среднее (trimmed mean) — одна из наиболее распространённых L-оценок. Для выборки объёма \(n\) и параметра усечения \(\alpha\) (обычно \(0 < \alpha < 0.5\)) отбрасываются \(\lfloor \alpha n \rfloor\) наименьших и \(\lfloor \alpha n \rfloor\) наибольших наблюдений. Оставшиеся наблюдения усредняются с равными весами:

\[ \bar{X}_{\text{trim}} = \frac{1}{n - 2\lfloor \alpha n \rfloor} \sum_{i = \lfloor \alpha n \rfloor + 1}^{n - \lfloor \alpha n \rfloor} X_{(i)}. \]

При \(\alpha = 0\) усечённое среднее совпадает с обычным арифметическим средним, при \(\alpha \to 0.5\) — с медианой.

Медиана

Медиана является частным случаем L-оценки с весами: \(w_i = 1\) для \(i = \lfloor n/2 \rfloor + 1\) (при нечётном \(n\)) или \(w_i = 0.5\) для двух центральных значений (при чётном \(n\)). Медиана обладает максимальной робастностью (точка разрушения 50%), но меньшей эффективностью при нормальном распределении.

Оценка Ходжеса-Лемана

Оценка Ходжеса-Лемана (Hodges-Lehmann estimator) для центра симметричного распределения определяется как медиана всех полусумм пар наблюдений:

\[ \hat{\theta}_{\text{HL}} = \text{median} \left\{ \frac{X_i + X_j}{2}, \, 1 \le i \le j \le n \right\}. \]

Эта оценка также является L-оценкой, так как может быть выражена через порядковые статистики. Она обладает высокой эффективностью (около 95% при нормальном распределении) и хорошей робастностью.

Свойства L-оценок

Робастность

L-оценки обладают высокой робастностью, то есть устойчивостью к выбросам и отклонениям от модельных предположений. Ключевыми показателями робастности являются:

  • Точка разрушения (breakdown point) — максимальная доля выбросов, которую оценка может выдержать без катастрофического искажения. Для медианы точка разрушения равна 50%, для усечённого среднего с \(\alpha = 0.1\) — 10%.
  • Чувствительность к выбросам (influence function) — для L-оценок она ограничена, что означает, что влияние одного выброса на оценку не может быть сколь угодно большим.

Эффективность

При нормальном распределении L-оценки, как правило, менее эффективны, чем обычное арифметическое среднее (которое является оптимальной оценкой для нормального распределения). Однако для распределений с тяжёлыми хвостами (например, распределение Коши) L-оценки могут быть значительно эффективнее среднего. Например, усечённое среднее с \(\alpha = 0.1\) имеет эффективность около 95% при нормальном распределении и существенно выше при засорённых распределениях.

Асимптотическая нормальность

При выполнении определённых условий (например, существование моментов и регулярность весовой функции) L-оценки являются асимптотически нормальными. Это позволяет строить доверительные интервалы и проверять гипотезы на основе L-оценок.

Применение

L-оценки широко применяются в различных областях, где требуется устойчивость к выбросам:

  • Статистический контроль качества — для оценки среднего уровня процесса при наличии выбросов (например, усечённое среднее используется в контрольных картах).
  • Финансовая математика — для оценки рисков и доходностей активов, где распределения часто имеют тяжёлые хвосты.
  • Биостатистика — при анализе медицинских данных, где выбросы могут быть вызваны ошибками измерений или редкими событиями.
  • Обработка сигналов и изображений — для фильтрации шумов (например, медианный фильтр — частный случай L-оценки).
  • Эконометрика — для построения робастных регрессионных моделей (L-оценки используются в робастной регрессии).

Сравнение с другими робастными оценками

  • M-оценки — более гибкие, но требуют итеративных вычислений и могут быть чувствительны к начальному приближению. L-оценки проще в вычислении и не требуют итераций.
  • R-оценки — основаны на рангах и часто эквивалентны L-оценкам для симметричных распределений, но могут быть сложнее в интерпретации.
  • S-оценки — обладают высокой точкой разрушения (до 50%), но требуют более сложных вычислений.

L-оценки занимают промежуточное положение по сложности и робастности между простым средним и более сложными робастными методами.

Критика и ограничения

  • Потеря информации — при усечении или винзоризации часть данных отбрасывается или модифицируется, что может приводить к потере информации, особенно при малых выборках.
  • Выбор параметра усечения — выбор \(\alpha\) (или другого параметра) является субъективным и может влиять на результаты. Не существует универсального оптимального значения.
  • Эффективность при нормальном распределении — для идеально нормальных данных L-оценки менее эффективны, чем среднее, что может быть недостатком в ситуациях, где нормальность гарантирована.
  • Несостоятельность для некоторых распределений — для распределений с бесконечными моментами (например, распределение Коши) некоторые L-оценки могут быть несостоятельными.

Интересные факты

  • Медиана, как частный случай L-оценки, была известна ещё в древности (использовалась в астрономии для обработки наблюдений).
  • Термин «L-оценка» был введён в 1970-х годах для унификации различных методов, основанных на порядковых статистиках.
  • В современной машинной обучении L-оценки используются в градиентном бустинге для построения робастных функций потерь.

Источники

  • Хьюбер П. Робастность в статистике. — М.: Мир, 1984.
  • Hampel F. R., Ronchetti E. M., Rousseeuw P. J., Stahel W. A. Robust Statistics: The Approach Based on Influence Functions. — Wiley, 1986.
  • Wilcox R. R. Introduction to Robust Estimation and Hypothesis Testing. — Academic Press, 2012.
  • Maronna R. A., Martin R. D., Yohai V. J. Robust Statistics: Theory and Methods. — Wiley, 2006.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →