Открыть сервис

Распределение Фишера — Снедекора

Распределение Фишера — Снедекора (также F-распределение, распределение Фишера) — это непрерывное распределение вероятностей, которое возникает в математической статистике как распределение отношения двух независимых случайных величин, имеющих распределение хи-квадрат, нормированных на соответствующие степени свободы. Названо в честь английского статистика Рональда Фишера и американского математика Джорджа Снедекора. Широко применяется в дисперсионном анализе (ANOVA), регрессионном анализе и при проверке гипотез о равенстве дисперсий двух нормальных совокупностей.

Определение

Пусть \(U\) и \(V\) — две независимые случайные величины, имеющие распределение хи-квадрат с \(d_1\) и \(d_2\) степенями свободы соответственно. Тогда случайная величина

\[ F = \frac{U / d_1}{V / d_2} \]

имеет распределение Фишера — Снедекора с \(d_1\) и \(d_2\) степенями свободы. Параметр \(d_1\) называется числом степеней свободы числителя, а \(d_2\) — числом степеней свободы знаменателя.

Функция плотности вероятности F-распределения задаётся формулой:

\[ f(x; d_1, d_2) = \frac{\sqrt{\frac{(d_1 x)^{d_1} d_2^{d_2}}{(d_1 x + d_2)^{d_1 + d_2}}}}{x \, B(d_1/2, d_2/2)}, \quad x > 0, \]

где \(B\) — бета-функция. Для \(x \leq 0\) плотность равна нулю.

История

Распределение было впервые выведено Рональдом Фишером в 1924 году в контексте дисперсионного анализа. Фишер использовал его для проверки гипотез о равенстве средних нескольких групп. Позднее, в 1934 году, Джордж Снедекор опубликовал таблицы процентных точек этого распределения, что сделало его доступным для практического использования. В честь Снедекора распределение часто обозначается как F-распределение, а статистика критерия — как F-статистика.

Свойства

Основные характеристики

\[ Var(F) = \frac{2 d_2^2 (d_1 + d_2 - 2)}{d_1 (d_2 - 2)^2 (d_2 - 4)}. \]

  • Мода: для \(d_1 > 2\) мода равна \(\frac{d_2 (d_1 - 2)}{d_1 (d_2 + 2)}\).

Форма распределения

F-распределение является асимметричным (правосторонняя асимметрия). При увеличении числа степеней свободы \(d_1\) и \(d_2\) распределение приближается к нормальному, но асимптотически — к распределению хи-квадрат при больших \(d_2\).

Связь с другими распределениями

  • Если \(F \sim F(d_1, d_2)\), то \(1/F \sim F(d_2, d_1)\).
  • Если \(t \sim t(d)\) — распределение Стьюдента с \(d\) степенями свободы, то \(t^2 \sim F(1, d)\).
  • Если \(X \sim \chi^2(d)\), то \(X/d \sim F(d, \infty)\) в пределе.

Применение

Дисперсионный анализ (ANOVA)

Основное применение F-распределения — в однофакторном и многофакторном дисперсионном анализе. F-статистика вычисляется как отношение межгрупповой дисперсии к внутригрупповой. По её значению проверяется нулевая гипотеза о равенстве средних нескольких групп. Если наблюдаемое значение F превышает критическое (из таблиц F-распределения), гипотеза отвергается.

Проверка гипотез о равенстве дисперсий

F-критерий используется для проверки гипотезы \(H_0: \sigma_1^2 = \sigma_2^2\) против альтернативы. Статистика критерия:

\[ F = \frac{S_1^2}{S_2^2}, \]

где \(S_1^2\) и \(S_2^2\) — выборочные дисперсии двух независимых нормальных совокупностей. При справедливости \(H_0\) эта статистика имеет распределение Фишера — Снедекора с \(n_1 - 1\) и \(n_2 - 1\) степенями свободы.

Регрессионный анализ

В линейной регрессии F-тест проверяет общую значимость модели: нулевая гипотеза состоит в том, что все коэффициенты регрессии (кроме свободного члена) равны нулю. F-статистика вычисляется как отношение регрессионной дисперсии к остаточной.

Другие области

  • В эконометрике — для тестирования ограничений на параметры моделей.
  • В биологии и медицине — для сравнения дисперсий в экспериментах.
  • В инженерии — для анализа качества продукции.

Таблицы и квантили

Поскольку функция распределения F не выражается в элементарных функциях, для практических расчётов используются таблицы квантилей (процентных точек). Для заданных уровней значимости \(\alpha\) (обычно 0.05, 0.01, 0.001) и чисел степеней свободы \(d_1, d_2\) в таблицах приводятся значения \(F_{\alpha}(d_1, d_2)\), такие что \(P(F > F_{\alpha}) = \alpha\). Современные статистические пакеты (R, Python, SPSS, SAS) вычисляют F-распределение численно.

Пример

Пусть имеются две независимые выборки из нормальных совокупностей: первая объёмом \(n_1 = 10\) (дисперсия \(S_1^2 = 25\)), вторая — \(n_2 = 15\) (дисперсия \(S_2^2 = 10\)). Для проверки гипотезы о равенстве дисперсий вычисляется F-статистика:

\[ F = \frac{25}{10} = 2.5. \]

Числа степеней свободы: \(d_1 = 9\), \(d_2 = 14\). По таблице F-распределения для \(\alpha = 0.05\) критическое значение \(F_{0.05}(9, 14) \approx 2.65\). Так как 2.5 < 2.65, нулевая гипотеза не отвергается на уровне значимости 5%.

Критика и ограничения

F-критерий чувствителен к нарушению предположения о нормальности распределений. При отклонении от нормальности (особенно при наличии выбросов) результаты теста могут быть ненадёжными. В таких случаях применяются робастные методы (например, критерий Брауна — Форсайта). Кроме того, F-тест для равенства дисперсий не является робастным к несимметричным распределениям.

Источники

  • Фишер Р. А. Статистические методы для исследователей. — М.: Госстатиздат, 1958.
  • Снедекор Дж. У. Статистические методы в применении к исследованиям в сельском хозяйстве и биологии. — М.: Сельхозгиз, 1961.
  • Кендалл М. Дж., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973.
  • Боровков А. А. Математическая статистика. — М.: Наука, 1984.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →