Распределение Хотеллинга
Распределение Хотеллинга (также распределение Хотеллинга \(T^2\)) — это многомерное вероятностное распределение, являющееся обобщением распределения Стьюдента на случай нескольких переменных. Оно возникает в статистике при проверке гипотез о средних значениях многомерной нормальной совокупности, когда ковариационная матрица неизвестна и оценивается по выборке. Распределение названо в честь американского статистика и экономиста Гарольда Хотеллинга, который впервые описал его в 1931 году.
Определение
Пусть \(\mathbf{x}_1, \mathbf{x}_2, \dots, \mathbf{x}_n\) — независимые случайные векторы размерности \(p\), каждый из которых имеет многомерное нормальное распределение \(N_p(\boldsymbol{\mu}, \boldsymbol{\Sigma})\) с неизвестным вектором средних \(\boldsymbol{\mu}\) и неизвестной положительно определённой ковариационной матрицей \(\boldsymbol{\Sigma}\). Определим выборочный вектор средних:
\[ \bar{\mathbf{x}} = \frac{1}{n}\sum_{i=1}^{n}\mathbf{x}_i \]
и выборочную ковариационную матрицу (несмещённую оценку):
\[ \mathbf{S} = \frac{1}{n-1}\sum_{i=1}^{n}(\mathbf{x}_i - \bar{\mathbf{x}})(\mathbf{x}_i - \bar{\mathbf{x}})^T. \]
Тогда статистика Хотеллинга определяется как:
\[ T^2 = n(\bar{\mathbf{x}} - \boldsymbol{\mu})^T \mathbf{S}^{-1} (\bar{\mathbf{x}} - \boldsymbol{\mu}). \]
Статистика \(T^2\) имеет распределение Хотеллинга с параметрами \(p\) и \(n-1\), что обозначается как \(T^2 \sim T^2(p, n-1)\). В более общем виде, для двух выборок объёмов \(n_1\) и \(n_2\) с общей ковариационной матрицей, распределение Хотеллинга определяется с параметрами \(p\) и \(n_1 + n_2 - 2\).
Связь с распределением Фишера
Распределение Хотеллинга тесно связано с \(F\)-распределением (распределением Фишера). Для статистики \(T^2\) справедливо следующее преобразование:
\[ \frac{n-p}{p(n-1)} T^2 \sim F(p, n-p), \]
где \(F(p, n-p)\) — распределение Фишера с \(p\) и \(n-p\) степенями свободы. Это соотношение позволяет использовать таблицы \(F\)-распределения для проверки гипотез и построения доверительных областей. В случае двух выборок аналогичное преобразование имеет вид:
\[ \frac{n_1 + n_2 - p - 1}{p(n_1 + n_2 - 2)} T^2 \sim F(p, n_1 + n_2 - p - 1). \]
Свойства
Моменты
Математическое ожидание статистики \(T^2\) существует при \(n > p\) и равно:
\[ \mathbb{E}[T^2] = \frac{p(n-1)}{n-p-1}. \]
Дисперсия существует при \(n > p+2\) и выражается формулой:
\[ \text{Var}[T^2] = \frac{2p(n-1)^2(n-2)}{(n-p-1)^2(n-p-3)}. \]
Асимптотическое поведение
При \(n \to \infty\) распределение Хотеллинга сходится к распределению хи-квадрат с \(p\) степенями свободы. Это свойство отражает тот факт, что при больших объёмах выборки выборочная ковариационная матрица \(\mathbf{S}\) становится близка к истинной \(\boldsymbol{\Sigma}\), и статистика \(T^2\) ведёт себя как статистика Уилкса.
Инвариантность
Распределение Хотеллинга инвариантно относительно невырожденных линейных преобразований данных. Если применить к векторам \(\mathbf{x}_i\) преобразование \(\mathbf{y}_i = \mathbf{A}\mathbf{x}_i + \mathbf{b}\), где \(\mathbf{A}\) — невырожденная матрица размера \(p \times p\), то статистика \(T^2\), вычисленная по \(\mathbf{y}_i\), будет иметь то же распределение, что и по исходным данным.
Применение
Проверка гипотезы о векторе средних
Основное применение распределения Хотеллинга — проверка гипотезы \(H_0: \boldsymbol{\mu} = \boldsymbol{\mu}_0\) против альтернативы \(H_1: \boldsymbol{\mu} \neq \boldsymbol{\mu}_0\). Для этого вычисляется наблюдаемое значение статистики:
\[ T^2_{\text{набл}} = n(\bar{\mathbf{x}} - \boldsymbol{\mu}_0)^T \mathbf{S}^{-1} (\bar{\mathbf{x}} - \boldsymbol{\mu}_0), \]
которое затем сравнивается с критическим значением, полученным из \(F\)-распределения. Если \(T^2_{\text{набл}}\) превышает критическое значение, нулевая гипотеза отвергается.
Сравнение двух многомерных выборок
Распределение Хотеллинга используется для проверки гипотезы о равенстве векторов средних двух независимых многомерных совокупностей (двухвыборочный критерий Хотеллинга). В этом случае статистика строится на основе разности выборочных средних и объединённой оценки ковариационной матрицы.
Построение доверительных областей
На основе распределения Хотеллинга строятся доверительные эллипсоиды для вектора средних \(\boldsymbol{\mu}\). Доверительная область уровня \(1-\alpha\) задаётся неравенством:
\[ n(\bar{\mathbf{x}} - \boldsymbol{\mu})^T \mathbf{S}^{-1} (\bar{\mathbf{x}} - \boldsymbol{\mu}) \leq \frac{p(n-1)}{n-p} F_{1-\alpha}(p, n-p), \]
где \(F_{1-\alpha}(p, n-p)\) — квантиль уровня \(1-\alpha\) распределения Фишера.
Контроль качества
В многомерном статистическом контроле качества распределение Хотеллинга применяется для построения контрольных карт (\(T^2\)-карт). Они позволяют отслеживать стабильность технологического процесса по нескольким коррелированным характеристикам одновременно. Выход статистики \(T^2\) за верхнюю контрольную границу сигнализирует о разладке процесса.
Анализ выбросов
Статистика Хотеллинга используется для обнаружения многомерных выбросов. Для каждого наблюдения \(\mathbf{x}_i\) вычисляется расстояние Махаланобиса до центра выборки, которое имеет распределение, связанное с \(T^2\). Наблюдения с аномально большими значениями расстояния считаются потенциальными выбросами.
Частные случаи
- Одномерный случай (\(p=1\)): Распределение Хотеллинга вырождается в распределение Стьюдента. Статистика \(T^2\) превращается в квадрат обычной \(t\)-статистики: \(T^2 = t^2\).
- Случай одной выборки с известной ковариационной матрицей: Если \(\boldsymbol{\Sigma}\) известна, то статистика \(n(\bar{\mathbf{x}} - \boldsymbol{\mu})^T \boldsymbol{\Sigma}^{-1} (\bar{\mathbf{x}} - \boldsymbol{\mu})\) имеет распределение хи-квадрат с \(p\) степенями свободы, а не распределение Хотеллинга.
История
Гарольд Хотеллинг (1895–1973) ввёл это распределение в 1931 году в статье «The Generalization of Student’s Ratio» (Обобщение отношения Стьюдента), опубликованной в журнале Annals of Mathematical Statistics. Работа Хотеллинга стала важным шагом в развитии многомерного статистического анализа. Он показал, как обобщить одновыборочный \(t\)-критерий на случай нескольких переменных, и вывел связь с \(F\)-распределением. Впоследствии распределение было распространено на случай двух выборок и других задач.
Источники
- Хотеллинг, Г. (1931). «The Generalization of Student’s Ratio». Annals of Mathematical Statistics, 2(3), 360–378.
- Андерсон, Т. У. (2003). Введение в многомерный статистический анализ. М.: Физматлит.
- Моррисон, Д. Ф. (2005). Многомерный статистический анализ. М.: Финансы и статистика.
- Джонсон, Р. А., Вичерн, Д. У. (2007). Прикладной многомерный статистический анализ. М.: Издательский дом «Вильямс».
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →