U-статистика
U-статистика — это класс статистических оценок, основанных на средних значениях функций от выборок фиксированного размера, введённый американским математиком Вассерманом Хёффдингом в 1948 году. U-статистики представляют собой обобщение выборочного среднего на случай произвольных симметричных функций от нескольких наблюдений и широко используются в непараметрической статистике, теории ранговых критериев и робастном оценивании. Название происходит от английского слова «unbiased» (несмещённый), поскольку U-статистики являются несмещёнными оценками соответствующих функционалов распределения.
Определение и формальное представление
Пусть \(X_1, X_2, \dots, X_n\) — независимые одинаково распределённые случайные величины с функцией распределения \(F\). Пусть \(h(x_1, \dots, x_m)\) — симметричная функция \(m\) аргументов, называемая ядром. Тогда U-статистика с ядром \(h\) и порядком \(m\) определяется как:
\[ U_n = \frac{1}{C_n^m} \sum_{1 \le i_1 < i_2 < \dots < i_m \le n} h(X_{i_1}, X_{i_2}, \dots, X_{i_m}), \]
где \(C_n^m = \frac{n!}{m!(n-m)!}\) — число сочетаний из \(n\) по \(m\). Суммирование ведётся по всем подмножествам индексов размера \(m\) из \(\{1, \dots, n\}\).
Ключевое свойство: если \(\mathbb{E}[h(X_1, \dots, X_m)] = \theta\) для некоторого параметра \(\theta\), то \(\mathbb{E}[U_n] = \theta\), то есть U-статистика является несмещённой оценкой \(\theta\).
История
Концепция U-статистики была предложена Вассерманом Хёффдингом в 1948 году в работе «A class of statistics with asymptotically normal distribution». Хёффдинг обобщил более ранние результаты, полученные для частных случаев, таких как выборочная дисперсия и коэффициент корреляции. В 1950-х годах теория была развита в работах Г. Крамера, Э. Лемана и других статистиков. В СССР и России вклад в развитие теории U-статистик внесли Ю. В. Прохоров, В. В. Сазонов и А. А. Боровков, которые исследовали асимптотические свойства и предельные распределения.
Основные свойства
Несмещённость
По построению, U-статистика является несмещённой оценкой параметра \(\theta = \mathbb{E}[h(X_1, \dots, X_m)]\). Это свойство сохраняется для любого объёма выборки \(n \ge m\).
Асимптотическая нормальность
При выполнении условия \(\mathbb{E}[h^2] < \infty\) U-статистика асимптотически нормальна:
\[ \sqrt{n}(U_n - \theta) \xrightarrow{d} N(0, m^2 \sigma_1^2), \]
где \(\sigma_1^2 = \text{Var}\left(\mathbb{E}[h(X_1, \dots, X_m) \mid X_1]\right)\) — дисперсия проекции ядра на одно наблюдение. Этот результат был доказан Хёффдингом и является аналогом центральной предельной теоремы для зависимых сумм.
Дисперсия
Дисперсия U-статистики выражается через так называемые «проекции» ядра:
\[ \text{Var}(U_n) = \frac{1}{C_n^m} \sum_{c=1}^m C_m^c C_{n-m}^{m-c} \sigma_c^2, \]
где \(\sigma_c^2 = \text{Var}\left(\mathbb{E}[h(X_1, \dots, X_m) \mid X_1, \dots, X_c]\right)\). Для больших \(n\) доминирует член с \(c=1\), что даёт асимптотическую дисперсию \(m^2 \sigma_1^2 / n\).
Эффективность
U-статистики часто являются оптимальными в смысле минимальной дисперсии среди несмещённых оценок (UMVUE), если распределение принадлежит экспоненциальному семейству. Однако в общем случае они могут быть неэффективны по сравнению с оценками максимального правдоподобия.
Примеры U-статистик
Выборочное среднее
При \(m=1\) и ядре \(h(x) = x\) U-статистика совпадает с выборочным средним:
\[ U_n = \frac{1}{n} \sum_{i=1}^n X_i. \]
Выборочная дисперсия
При \(m=2\) и ядре \(h(x_1, x_2) = \frac{1}{2}(x_1 - x_2)^2\) U-статистика даёт несмещённую оценку дисперсии:
\[ U_n = \frac{1}{n(n-1)} \sum_{i<j} (X_i - X_j)^2 = \frac{1}{n-1} \sum_{i=1}^n (X_i - \bar{X})^2. \]
Статистика Уилкоксона
Для двухвыборочного критерия Уилкоксона (Манна — Уитни) ядро имеет вид \(h(x, y) = I(x < y)\), где \(I\) — индикаторная функция. U-статистика оценивает вероятность \(P(X < Y)\):
\[ U = \frac{1}{n_1 n_2} \sum_{i=1}^{n_1} \sum_{j=1}^{n_2} I(X_i < Y_j). \]
Коэффициент корреляции Кендалла
Для измерения ранговой корреляции между двумя переменными используется ядро \(h((x_1, y_1), (x_2, y_2)) = \text{sign}(x_1 - x_2) \cdot \text{sign}(y_1 - y_2)\). U-статистика даёт несмещённую оценку коэффициента корреляции Кендалла.
Gini-коэффициент
В экономике и социологии для измерения неравенства используется ядро \(h(x_1, x_2) = |x_1 - x_2|\). U-статистика пропорциональна коэффициенту Джини.
Применение
Непараметрическая статистика
U-статистики лежат в основе многих непараметрических критериев, таких как:
- критерий Уилкоксона — Манна — Уитни для сравнения двух выборок;
- критерий Краскела — Уоллиса для множественного сравнения;
- критерий Ансари — Брэдли для проверки дисперсий.
Робастное оценивание
U-статистики с усечёнными или взвешенными ядрами используются для построения робастных оценок, устойчивых к выбросам. Например, оценка Хьюбера для среднего может быть представлена как модифицированная U-статистика.
Оценивание функционалов распределения
U-статистики позволяют оценивать произвольные гладкие функционалы распределения, такие как моменты, квантили, функции влияния. Они применяются в теории влиятельных наблюдений и анализе чувствительности.
Машинное обучение
В современной статистике U-статистики используются для оценки обобщающей способности алгоритмов (например, в методе скользящего контроля, кросс-валидации). Также они применяются в задачах ранжирования и метрического обучения.
Обобщения и родственные понятия
V-статистики
V-статистики (von Mises statistics) отличаются от U-статистик тем, что суммирование ведётся по всем \(n^m\) упорядоченным наборам индексов, включая повторяющиеся. Они являются асимптотически эквивалентными, но смещёнными.
Многомерные U-статистики
Обобщение на случай нескольких выборок, где ядро зависит от наблюдений из разных распределений. Используются в дисперсионном анализе и многомерных критериях.
U-процессы
Семейства U-статистик, индексированные параметром (например, ядром, зависящим от точки). Изучаются в теории эмпирических процессов и применяются в непараметрической регрессии.
Критика и ограничения
- Вычислительная сложность: для больших \(n\) и \(m\) число слагаемых \(C_n^m\) растёт экспоненциально, что делает прямой расчёт невозможным. Для преодоления этого используются приближения (например, метод Хеффдинга — Серфлинга) или вычислительные алгоритмы (стохастическая аппроксимация).
- Чувствительность к выбросам: стандартные U-статистики с неограниченными ядрами могут быть неустойчивы к аномальным наблюдениям. Для робастности требуются модификации ядра.
- Асимптотическая эффективность: в некоторых случаях U-статистики уступают по эффективности другим методам, таким как оценки максимального правдоподобия.
Интересные факты
- Термин «U-статистика» был предложен Хёффдингом в честь «unbiased» (несмещённый), хотя сам Хёффдинг первоначально использовал термин «H-статистика» (по своей фамилии).
- U-статистики тесно связаны с теорией рангов и комбинаторикой: они могут быть выражены через ранги наблюдений.
- В 1970-х годах советский математик В. В. Сазонов доказал точные неравенства для скорости сходимости в центральной предельной теореме для U-статистик.
Источники
- Hoeffding, W. (1948). «A class of statistics with asymptotically normal distribution». Annals of Mathematical Statistics, 19(3), 293–325.
- Serfling, R. J. (1980). Approximation Theorems of Mathematical Statistics. Wiley.
- Боровков, А. А. (1998). Математическая статистика. М.: Наука.
- van der Vaart, A. W. (1998). Asymptotic Statistics. Cambridge University Press.
- Прохоров, Ю. В., Сазонов, В. В. (1973). «Оценки скорости сходимости в центральной предельной теореме для U-статистик». Теория вероятностей и её применения, 18(4), 703–718.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →