Распределение Фишера — Снедекора
Распределение Фишера — Снедекора (также F-распределение, распределение Фишера) — это непрерывное распределение вероятностей, которое возникает в математической статистике как распределение отношения двух независимых случайных величин, имеющих распределение хи-квадрат, нормированных на соответствующие степени свободы. Названо в честь английского статистика Рональда Фишера и американского математика Джорджа Снедекора. Широко применяется в дисперсионном анализе (ANOVA), регрессионном анализе и при проверке гипотез о равенстве дисперсий двух нормальных совокупностей.
Определение
Пусть \(U\) и \(V\) — две независимые случайные величины, имеющие распределение хи-квадрат с \(d_1\) и \(d_2\) степенями свободы соответственно. Тогда случайная величина
\[ F = \frac{U / d_1}{V / d_2} \]
имеет распределение Фишера — Снедекора с \(d_1\) и \(d_2\) степенями свободы. Параметр \(d_1\) называется числом степеней свободы числителя, а \(d_2\) — числом степеней свободы знаменателя.
Функция плотности вероятности F-распределения задаётся формулой:
\[ f(x; d_1, d_2) = \frac{\sqrt{\frac{(d_1 x)^{d_1} d_2^{d_2}}{(d_1 x + d_2)^{d_1 + d_2}}}}{x \, B(d_1/2, d_2/2)}, \quad x > 0, \]
где \(B\) — бета-функция. Для \(x \leq 0\) плотность равна нулю.
История
Распределение было впервые выведено Рональдом Фишером в 1924 году в контексте дисперсионного анализа. Фишер использовал его для проверки гипотез о равенстве средних нескольких групп. Позднее, в 1934 году, Джордж Снедекор опубликовал таблицы процентных точек этого распределения, что сделало его доступным для практического использования. В честь Снедекора распределение часто обозначается как F-распределение, а статистика критерия — как F-статистика.
Свойства
Основные характеристики
- Математическое ожидание: существует только при \(d_2 > 2\) и равно \(E[F] = \frac{d_2}{d_2 - 2}\).
- Дисперсия: существует только при \(d_2 > 4\) и вычисляется по формуле:
\[ Var(F) = \frac{2 d_2^2 (d_1 + d_2 - 2)}{d_1 (d_2 - 2)^2 (d_2 - 4)}. \]
- Мода: для \(d_1 > 2\) мода равна \(\frac{d_2 (d_1 - 2)}{d_1 (d_2 + 2)}\).
Форма распределения
F-распределение является асимметричным (правосторонняя асимметрия). При увеличении числа степеней свободы \(d_1\) и \(d_2\) распределение приближается к нормальному, но асимптотически — к распределению хи-квадрат при больших \(d_2\).
Связь с другими распределениями
- Если \(F \sim F(d_1, d_2)\), то \(1/F \sim F(d_2, d_1)\).
- Если \(t \sim t(d)\) — распределение Стьюдента с \(d\) степенями свободы, то \(t^2 \sim F(1, d)\).
- Если \(X \sim \chi^2(d)\), то \(X/d \sim F(d, \infty)\) в пределе.
Применение
Дисперсионный анализ (ANOVA)
Основное применение F-распределения — в однофакторном и многофакторном дисперсионном анализе. F-статистика вычисляется как отношение межгрупповой дисперсии к внутригрупповой. По её значению проверяется нулевая гипотеза о равенстве средних нескольких групп. Если наблюдаемое значение F превышает критическое (из таблиц F-распределения), гипотеза отвергается.
Проверка гипотез о равенстве дисперсий
F-критерий используется для проверки гипотезы \(H_0: \sigma_1^2 = \sigma_2^2\) против альтернативы. Статистика критерия:
\[ F = \frac{S_1^2}{S_2^2}, \]
где \(S_1^2\) и \(S_2^2\) — выборочные дисперсии двух независимых нормальных совокупностей. При справедливости \(H_0\) эта статистика имеет распределение Фишера — Снедекора с \(n_1 - 1\) и \(n_2 - 1\) степенями свободы.
Регрессионный анализ
В линейной регрессии F-тест проверяет общую значимость модели: нулевая гипотеза состоит в том, что все коэффициенты регрессии (кроме свободного члена) равны нулю. F-статистика вычисляется как отношение регрессионной дисперсии к остаточной.
Другие области
- В эконометрике — для тестирования ограничений на параметры моделей.
- В биологии и медицине — для сравнения дисперсий в экспериментах.
- В инженерии — для анализа качества продукции.
Таблицы и квантили
Поскольку функция распределения F не выражается в элементарных функциях, для практических расчётов используются таблицы квантилей (процентных точек). Для заданных уровней значимости \(\alpha\) (обычно 0.05, 0.01, 0.001) и чисел степеней свободы \(d_1, d_2\) в таблицах приводятся значения \(F_{\alpha}(d_1, d_2)\), такие что \(P(F > F_{\alpha}) = \alpha\). Современные статистические пакеты (R, Python, SPSS, SAS) вычисляют F-распределение численно.
Пример
Пусть имеются две независимые выборки из нормальных совокупностей: первая объёмом \(n_1 = 10\) (дисперсия \(S_1^2 = 25\)), вторая — \(n_2 = 15\) (дисперсия \(S_2^2 = 10\)). Для проверки гипотезы о равенстве дисперсий вычисляется F-статистика:
\[ F = \frac{25}{10} = 2.5. \]
Числа степеней свободы: \(d_1 = 9\), \(d_2 = 14\). По таблице F-распределения для \(\alpha = 0.05\) критическое значение \(F_{0.05}(9, 14) \approx 2.65\). Так как 2.5 < 2.65, нулевая гипотеза не отвергается на уровне значимости 5%.
Критика и ограничения
F-критерий чувствителен к нарушению предположения о нормальности распределений. При отклонении от нормальности (особенно при наличии выбросов) результаты теста могут быть ненадёжными. В таких случаях применяются робастные методы (например, критерий Брауна — Форсайта). Кроме того, F-тест для равенства дисперсий не является робастным к несимметричным распределениям.
Источники
- Фишер Р. А. Статистические методы для исследователей. — М.: Госстатиздат, 1958.
- Снедекор Дж. У. Статистические методы в применении к исследованиям в сельском хозяйстве и биологии. — М.: Сельхозгиз, 1961.
- Кендалл М. Дж., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973.
- Боровков А. А. Математическая статистика. — М.: Наука, 1984.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →