Открыть сервис

U-статистика

U-статистика — это класс статистических оценок, основанных на средних значениях функций от выборок фиксированного размера, введённый американским математиком Вассерманом Хёффдингом в 1948 году. U-статистики представляют собой обобщение выборочного среднего на случай произвольных симметричных функций от нескольких наблюдений и широко используются в непараметрической статистике, теории ранговых критериев и робастном оценивании. Название происходит от английского слова «unbiased» (несмещённый), поскольку U-статистики являются несмещёнными оценками соответствующих функционалов распределения.

Определение и формальное представление

Пусть \(X_1, X_2, \dots, X_n\) — независимые одинаково распределённые случайные величины с функцией распределения \(F\). Пусть \(h(x_1, \dots, x_m)\) — симметричная функция \(m\) аргументов, называемая ядром. Тогда U-статистика с ядром \(h\) и порядком \(m\) определяется как:

\[ U_n = \frac{1}{C_n^m} \sum_{1 \le i_1 < i_2 < \dots < i_m \le n} h(X_{i_1}, X_{i_2}, \dots, X_{i_m}), \]

где \(C_n^m = \frac{n!}{m!(n-m)!}\) — число сочетаний из \(n\) по \(m\). Суммирование ведётся по всем подмножествам индексов размера \(m\) из \(\{1, \dots, n\}\).

Ключевое свойство: если \(\mathbb{E}[h(X_1, \dots, X_m)] = \theta\) для некоторого параметра \(\theta\), то \(\mathbb{E}[U_n] = \theta\), то есть U-статистика является несмещённой оценкой \(\theta\).

История

Концепция U-статистики была предложена Вассерманом Хёффдингом в 1948 году в работе «A class of statistics with asymptotically normal distribution». Хёффдинг обобщил более ранние результаты, полученные для частных случаев, таких как выборочная дисперсия и коэффициент корреляции. В 1950-х годах теория была развита в работах Г. Крамера, Э. Лемана и других статистиков. В СССР и России вклад в развитие теории U-статистик внесли Ю. В. Прохоров, В. В. Сазонов и А. А. Боровков, которые исследовали асимптотические свойства и предельные распределения.

Основные свойства

Несмещённость

По построению, U-статистика является несмещённой оценкой параметра \(\theta = \mathbb{E}[h(X_1, \dots, X_m)]\). Это свойство сохраняется для любого объёма выборки \(n \ge m\).

Асимптотическая нормальность

При выполнении условия \(\mathbb{E}[h^2] < \infty\) U-статистика асимптотически нормальна:

\[ \sqrt{n}(U_n - \theta) \xrightarrow{d} N(0, m^2 \sigma_1^2), \]

где \(\sigma_1^2 = \text{Var}\left(\mathbb{E}[h(X_1, \dots, X_m) \mid X_1]\right)\) — дисперсия проекции ядра на одно наблюдение. Этот результат был доказан Хёффдингом и является аналогом центральной предельной теоремы для зависимых сумм.

Дисперсия

Дисперсия U-статистики выражается через так называемые «проекции» ядра:

\[ \text{Var}(U_n) = \frac{1}{C_n^m} \sum_{c=1}^m C_m^c C_{n-m}^{m-c} \sigma_c^2, \]

где \(\sigma_c^2 = \text{Var}\left(\mathbb{E}[h(X_1, \dots, X_m) \mid X_1, \dots, X_c]\right)\). Для больших \(n\) доминирует член с \(c=1\), что даёт асимптотическую дисперсию \(m^2 \sigma_1^2 / n\).

Эффективность

U-статистики часто являются оптимальными в смысле минимальной дисперсии среди несмещённых оценок (UMVUE), если распределение принадлежит экспоненциальному семейству. Однако в общем случае они могут быть неэффективны по сравнению с оценками максимального правдоподобия.

Примеры U-статистик

Выборочное среднее

При \(m=1\) и ядре \(h(x) = x\) U-статистика совпадает с выборочным средним:

\[ U_n = \frac{1}{n} \sum_{i=1}^n X_i. \]

Выборочная дисперсия

При \(m=2\) и ядре \(h(x_1, x_2) = \frac{1}{2}(x_1 - x_2)^2\) U-статистика даёт несмещённую оценку дисперсии:

\[ U_n = \frac{1}{n(n-1)} \sum_{i<j} (X_i - X_j)^2 = \frac{1}{n-1} \sum_{i=1}^n (X_i - \bar{X})^2. \]

Статистика Уилкоксона

Для двухвыборочного критерия Уилкоксона (Манна — Уитни) ядро имеет вид \(h(x, y) = I(x < y)\), где \(I\) — индикаторная функция. U-статистика оценивает вероятность \(P(X < Y)\):

\[ U = \frac{1}{n_1 n_2} \sum_{i=1}^{n_1} \sum_{j=1}^{n_2} I(X_i < Y_j). \]

Коэффициент корреляции Кендалла

Для измерения ранговой корреляции между двумя переменными используется ядро \(h((x_1, y_1), (x_2, y_2)) = \text{sign}(x_1 - x_2) \cdot \text{sign}(y_1 - y_2)\). U-статистика даёт несмещённую оценку коэффициента корреляции Кендалла.

Gini-коэффициент

В экономике и социологии для измерения неравенства используется ядро \(h(x_1, x_2) = |x_1 - x_2|\). U-статистика пропорциональна коэффициенту Джини.

Применение

Непараметрическая статистика

U-статистики лежат в основе многих непараметрических критериев, таких как:

  • критерий Уилкоксона — Манна — Уитни для сравнения двух выборок;
  • критерий Краскела — Уоллиса для множественного сравнения;
  • критерий Ансари — Брэдли для проверки дисперсий.

Робастное оценивание

U-статистики с усечёнными или взвешенными ядрами используются для построения робастных оценок, устойчивых к выбросам. Например, оценка Хьюбера для среднего может быть представлена как модифицированная U-статистика.

Оценивание функционалов распределения

U-статистики позволяют оценивать произвольные гладкие функционалы распределения, такие как моменты, квантили, функции влияния. Они применяются в теории влиятельных наблюдений и анализе чувствительности.

Машинное обучение

В современной статистике U-статистики используются для оценки обобщающей способности алгоритмов (например, в методе скользящего контроля, кросс-валидации). Также они применяются в задачах ранжирования и метрического обучения.

Обобщения и родственные понятия

V-статистики

V-статистики (von Mises statistics) отличаются от U-статистик тем, что суммирование ведётся по всем \(n^m\) упорядоченным наборам индексов, включая повторяющиеся. Они являются асимптотически эквивалентными, но смещёнными.

Многомерные U-статистики

Обобщение на случай нескольких выборок, где ядро зависит от наблюдений из разных распределений. Используются в дисперсионном анализе и многомерных критериях.

U-процессы

Семейства U-статистик, индексированные параметром (например, ядром, зависящим от точки). Изучаются в теории эмпирических процессов и применяются в непараметрической регрессии.

Критика и ограничения

  • Вычислительная сложность: для больших \(n\) и \(m\) число слагаемых \(C_n^m\) растёт экспоненциально, что делает прямой расчёт невозможным. Для преодоления этого используются приближения (например, метод Хеффдинга — Серфлинга) или вычислительные алгоритмы (стохастическая аппроксимация).
  • Чувствительность к выбросам: стандартные U-статистики с неограниченными ядрами могут быть неустойчивы к аномальным наблюдениям. Для робастности требуются модификации ядра.
  • Асимптотическая эффективность: в некоторых случаях U-статистики уступают по эффективности другим методам, таким как оценки максимального правдоподобия.

Интересные факты

  • Термин «U-статистика» был предложен Хёффдингом в честь «unbiased» (несмещённый), хотя сам Хёффдинг первоначально использовал термин «H-статистика» (по своей фамилии).
  • U-статистики тесно связаны с теорией рангов и комбинаторикой: они могут быть выражены через ранги наблюдений.
  • В 1970-х годах советский математик В. В. Сазонов доказал точные неравенства для скорости сходимости в центральной предельной теореме для U-статистик.

Источники

  • Hoeffding, W. (1948). «A class of statistics with asymptotically normal distribution». Annals of Mathematical Statistics, 19(3), 293–325.
  • Serfling, R. J. (1980). Approximation Theorems of Mathematical Statistics. Wiley.
  • Боровков, А. А. (1998). Математическая статистика. М.: Наука.
  • van der Vaart, A. W. (1998). Asymptotic Statistics. Cambridge University Press.
  • Прохоров, Ю. В., Сазонов, В. В. (1973). «Оценки скорости сходимости в центральной предельной теореме для U-статистик». Теория вероятностей и её применения, 18(4), 703–718.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →