L-оценка
L-оценка — это робастная статистическая оценка, которая вычисляется как линейная комбинация порядковых статистик (то есть элементов выборки, упорядоченных по возрастанию). L-оценки являются одним из основных классов робастных оценок наряду с M-оценками (оценками максимального правдоподобия) и R-оценками (ранговыми оценками). Они обладают повышенной устойчивостью к выбросам и отклонениям от нормального распределения, сохраняя при этом высокую эффективность для широкого класса распределений. Термин «L-оценка» происходит от английского «linear» (линейный) и указывает на линейную форму зависимости от порядковых статистик.
Определение и общая формула
Пусть \(X_1, X_2, \dots, X_n\) — независимая выборка объёма \(n\) из некоторого распределения. Обозначим \(X_{(1)} \le X_{(2)} \le \dots \le X_{(n)}\) — упорядоченную выборку (порядковые статистики). Тогда L-оценка \(L\) параметра \(\theta\) (например, центра распределения) определяется как:
\[ L = \sum_{i=1}^{n} w_i X_{(i)}, \]
где \(w_i\) — весовые коэффициенты, удовлетворяющие условию \(\sum_{i=1}^{n} w_i = 1\) (для несмещённости оценки центра). Веса могут быть как постоянными (заданными аналитически), так и зависеть от \(n\) и типа распределения.
История
Идея использования линейных комбинаций порядковых статистик восходит к работам по теории порядковых статистик, начатым в 1940-х годах. В 1960-х годах концепция L-оценок была формализована в рамках развития робастной статистики, прежде всего в работах Питера Хьюбера и Фрэнка Хэмпеля. В 1970-х годах L-оценки получили широкое распространение благодаря их простоте и хорошим робастным свойствам. В 1980-х годах были разработаны асимптотические теории для L-оценок, включая их состоятельность и асимптотическую нормальность.
Классификация L-оценок
L-оценки можно классифицировать по нескольким признакам:
По типу весовой функции
- Усечённые (trimmed) L-оценки — веса для крайних порядковых статистик равны нулю, а для центральных — одинаковы. Пример: усечённое среднее.
- Винзоризованные (Winsorized) L-оценки — крайние значения заменяются на ближайшие к ним значения из выборки, после чего вычисляется обычное среднее.
- Оценки с гладкими весами — веса задаются непрерывной функцией от порядкового номера, например, ядерной функцией.
По оцениваемому параметру
- Оценки центра (например, медиана, усечённое среднее, оценка Ходжеса-Лемана).
- Оценки масштаба (например, межквартильный размах, медианное абсолютное отклонение).
- Оценки формы (например, асимметрии и эксцесса).
Примеры конкретных L-оценок
Усечённое среднее
Усечённое среднее (trimmed mean) — одна из наиболее распространённых L-оценок. Для выборки объёма \(n\) и параметра усечения \(\alpha\) (обычно \(0 < \alpha < 0.5\)) отбрасываются \(\lfloor \alpha n \rfloor\) наименьших и \(\lfloor \alpha n \rfloor\) наибольших наблюдений. Оставшиеся наблюдения усредняются с равными весами:
\[ \bar{X}_{\text{trim}} = \frac{1}{n - 2\lfloor \alpha n \rfloor} \sum_{i = \lfloor \alpha n \rfloor + 1}^{n - \lfloor \alpha n \rfloor} X_{(i)}. \]
При \(\alpha = 0\) усечённое среднее совпадает с обычным арифметическим средним, при \(\alpha \to 0.5\) — с медианой.
Медиана
Медиана является частным случаем L-оценки с весами: \(w_i = 1\) для \(i = \lfloor n/2 \rfloor + 1\) (при нечётном \(n\)) или \(w_i = 0.5\) для двух центральных значений (при чётном \(n\)). Медиана обладает максимальной робастностью (точка разрушения 50%), но меньшей эффективностью при нормальном распределении.
Оценка Ходжеса-Лемана
Оценка Ходжеса-Лемана (Hodges-Lehmann estimator) для центра симметричного распределения определяется как медиана всех полусумм пар наблюдений:
\[ \hat{\theta}_{\text{HL}} = \text{median} \left\{ \frac{X_i + X_j}{2}, \, 1 \le i \le j \le n \right\}. \]
Эта оценка также является L-оценкой, так как может быть выражена через порядковые статистики. Она обладает высокой эффективностью (около 95% при нормальном распределении) и хорошей робастностью.
Свойства L-оценок
Робастность
L-оценки обладают высокой робастностью, то есть устойчивостью к выбросам и отклонениям от модельных предположений. Ключевыми показателями робастности являются:
- Точка разрушения (breakdown point) — максимальная доля выбросов, которую оценка может выдержать без катастрофического искажения. Для медианы точка разрушения равна 50%, для усечённого среднего с \(\alpha = 0.1\) — 10%.
- Чувствительность к выбросам (influence function) — для L-оценок она ограничена, что означает, что влияние одного выброса на оценку не может быть сколь угодно большим.
Эффективность
При нормальном распределении L-оценки, как правило, менее эффективны, чем обычное арифметическое среднее (которое является оптимальной оценкой для нормального распределения). Однако для распределений с тяжёлыми хвостами (например, распределение Коши) L-оценки могут быть значительно эффективнее среднего. Например, усечённое среднее с \(\alpha = 0.1\) имеет эффективность около 95% при нормальном распределении и существенно выше при засорённых распределениях.
Асимптотическая нормальность
При выполнении определённых условий (например, существование моментов и регулярность весовой функции) L-оценки являются асимптотически нормальными. Это позволяет строить доверительные интервалы и проверять гипотезы на основе L-оценок.
Применение
L-оценки широко применяются в различных областях, где требуется устойчивость к выбросам:
- Статистический контроль качества — для оценки среднего уровня процесса при наличии выбросов (например, усечённое среднее используется в контрольных картах).
- Финансовая математика — для оценки рисков и доходностей активов, где распределения часто имеют тяжёлые хвосты.
- Биостатистика — при анализе медицинских данных, где выбросы могут быть вызваны ошибками измерений или редкими событиями.
- Обработка сигналов и изображений — для фильтрации шумов (например, медианный фильтр — частный случай L-оценки).
- Эконометрика — для построения робастных регрессионных моделей (L-оценки используются в робастной регрессии).
Сравнение с другими робастными оценками
- M-оценки — более гибкие, но требуют итеративных вычислений и могут быть чувствительны к начальному приближению. L-оценки проще в вычислении и не требуют итераций.
- R-оценки — основаны на рангах и часто эквивалентны L-оценкам для симметричных распределений, но могут быть сложнее в интерпретации.
- S-оценки — обладают высокой точкой разрушения (до 50%), но требуют более сложных вычислений.
L-оценки занимают промежуточное положение по сложности и робастности между простым средним и более сложными робастными методами.
Критика и ограничения
- Потеря информации — при усечении или винзоризации часть данных отбрасывается или модифицируется, что может приводить к потере информации, особенно при малых выборках.
- Выбор параметра усечения — выбор \(\alpha\) (или другого параметра) является субъективным и может влиять на результаты. Не существует универсального оптимального значения.
- Эффективность при нормальном распределении — для идеально нормальных данных L-оценки менее эффективны, чем среднее, что может быть недостатком в ситуациях, где нормальность гарантирована.
- Несостоятельность для некоторых распределений — для распределений с бесконечными моментами (например, распределение Коши) некоторые L-оценки могут быть несостоятельными.
Интересные факты
- Медиана, как частный случай L-оценки, была известна ещё в древности (использовалась в астрономии для обработки наблюдений).
- Термин «L-оценка» был введён в 1970-х годах для унификации различных методов, основанных на порядковых статистиках.
- В современной машинной обучении L-оценки используются в градиентном бустинге для построения робастных функций потерь.
Источники
- Хьюбер П. Робастность в статистике. — М.: Мир, 1984.
- Hampel F. R., Ronchetti E. M., Rousseeuw P. J., Stahel W. A. Robust Statistics: The Approach Based on Influence Functions. — Wiley, 1986.
- Wilcox R. R. Introduction to Robust Estimation and Hypothesis Testing. — Academic Press, 2012.
- Maronna R. A., Martin R. D., Yohai V. J. Robust Statistics: Theory and Methods. — Wiley, 2006.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →