Эмпирическая функция распределения
Эмпирическая функция распределения (также выборочная функция распределения) — это функция, которая для каждого значения \( x \) определяет долю наблюдений в выборке, не превосходящих \( x \). Она является статистической оценкой теоретической функции распределения генеральной совокупности и строится непосредственно по результатам наблюдений.
Определение
Пусть \( X_1, X_2, \dots, X_n \) — независимые одинаково распределённые случайные величины, образующие выборку объёма \( n \) из некоторого распределения с функцией распределения \( F(x) \). Эмпирической функцией распределения \( \hat{F}_n(x) \) называется функция, заданная формулой:
\[ \hat{F}_n(x) = \frac{1}{n} \sum_{i=1}^{n} \mathbf{1}_{\{X_i \le x\}}, \]
где \( \mathbf{1}_{\{X_i \le x\}} \) — индикатор события \( \{X_i \le x\} \), равный 1, если \( X_i \le x \), и 0 в противном случае. Иными словами, \( \hat{F}_n(x) \) равна отношению числа элементов выборки, не превышающих \( x \), к общему объёму выборки \( n \).
Свойства
Эмпирическая функция распределения обладает рядом важных свойств, которые делают её удобным инструментом в математической статистике.
Основные свойства
- Непрерывность справа и кусочное постоянство: \( \hat{F}_n(x) \) является ступенчатой функцией, непрерывной справа. Скачки происходят в точках, соответствующих значениям элементов выборки. Величина скачка в точке \( X_i \) равна \( \frac{1}{n} \), если все значения выборки различны, или \( \frac{k}{n} \), где \( k \) — кратность повторения данного значения.
- Границы значений: \( 0 \le \hat{F}_n(x) \le 1 \) для всех \( x \in \mathbb{R} \).
- Монотонность: \( \hat{F}_n(x) \) является неубывающей функцией.
- Предельное поведение: \( \lim_{x \to -\infty} \hat{F}_n(x) = 0 \), \( \lim_{x \to +\infty} \hat{F}_n(x) = 1 \).
Статистические свойства
- Несмещённость: Для любого фиксированного \( x \) математическое ожидание эмпирической функции распределения равно теоретической функции распределения: \( \mathbb{E}[\hat{F}_n(x)] = F(x) \). Это означает, что в среднем \( \hat{F}_n(x) \) не завышает и не занижает истинное значение \( F(x) \).
- Состоятельность: При увеличении объёма выборки \( n \) эмпирическая функция распределения сходится по вероятности к теоретической: \( \hat{F}_n(x) \xrightarrow{p} F(x) \) для любого \( x \). Более того, сходимость является равномерной по \( x \).
- Асимптотическая нормальность: Для фиксированного \( x \) распределение величины \( \sqrt{n}(\hat{F}_n(x) - F(x)) \) стремится к нормальному распределению с математическим ожиданием 0 и дисперсией \( F(x)(1 - F(x)) \).
Теорема Гливенко — Кантелли
Центральным результатом, обосновывающим использование эмпирической функции распределения как оценки теоретической, является теорема Гливенко — Кантелли (также известная как основная теорема математической статистики). Она утверждает, что эмпирическая функция распределения сходится к теоретической равномерно по всей числовой прямой почти наверное:
\[ \sup_{x \in \mathbb{R}} |\hat{F}_n(x) - F(x)| \xrightarrow{\text{п.н.}} 0, \quad n \to \infty. \]
Это означает, что при достаточно большом объёме выборки разница между \( \hat{F}_n(x) \) и \( F(x) \) становится сколь угодно малой одновременно для всех \( x \). Теорема является строгим математическим обоснованием того, что по выборочным данным можно с высокой точностью восстановить неизвестное распределение генеральной совокупности.
Построение и пример
Для построения эмпирической функции распределения по выборке \( x_1, x_2, \dots, x_n \) необходимо:
- Упорядочить выборку по возрастанию: \( x_{(1)} \le x_{(2)} \le \dots \le x_{(n)} \).
- Для каждого \( x \) определить \( k \) — количество элементов выборки, не превосходящих \( x \).
- Значение функции \( \hat{F}_n(x) \) равно \( k/n \).
Пример. Пусть имеется выборка объёма \( n = 5 \): \( \{2, 5, 3, 2, 4\} \). Упорядоченный ряд: \( 2, 2, 3, 4, 5 \). Эмпирическая функция распределения:
- \( \hat{F}_5(x) = 0 \) при \( x < 2 \);
- \( \hat{F}_5(x) = \frac{2}{5} = 0.4 \) при \( 2 \le x < 3 \);
- \( \hat{F}_5(x) = \frac{3}{5} = 0.6 \) при \( 3 \le x < 4 \);
- \( \hat{F}_5(x) = \frac{4}{5} = 0.8 \) при \( 4 \le x < 5 \);
- \( \hat{F}_5(x) = 1 \) при \( x \ge 5 \).
Применение
Эмпирическая функция распределения является фундаментальным понятием в прикладной статистике и используется в различных задачах:
- Описательная статистика: Служит для визуального представления распределения данных (например, в виде графика кумулятивной частоты).
- Оценка квантилей: Квантили эмпирического распределения (выборочные квантили) используются как оценки соответствующих квантилей генеральной совокупности.
- Проверка статистических гипотез: На основе эмпирической функции распределения построены критерии согласия, такие как критерий Колмогорова — Смирнова и критерий Крамера — Мизеса — Смирнова. Эти критерии позволяют проверить гипотезу о том, что выборка взята из заданного теоретического распределения.
- Бутстреп: В методах бутстрепа (статистического моделирования) эмпирическая функция распределения используется как оценка неизвестного распределения генеральной совокупности, и из неё многократно извлекаются псевдовыборки для оценки точности статистических показателей.
- Непараметрическая статистика: Эмпирическая функция распределения лежит в основе многих непараметрических методов, которые не требуют предположений о виде распределения данных.
Связь с гистограммой
Эмпирическая функция распределения и гистограмма являются двумя разными способами визуализации распределения данных. Гистограмма представляет собой кусочно-постоянную оценку плотности распределения, а эмпирическая функция распределения — оценку интегральной функции распределения. Гистограмма более чувствительна к выбору числа интервалов (бинов), в то время как эмпирическая функция распределения строится однозначно и не требует настройки параметров. Для выборок небольшого объёма эмпирическая функция распределения часто даёт более наглядное представление о распределении, чем гистограмма.
Интересные факты
- Термин «эмпирическая функция распределения» был введён в статистическую практику в начале XX века. Вклад в её теоретическое обоснование внесли такие математики, как В. И. Гливенко, Ф. П. Кантелли и А. Н. Колмогоров.
- Теорема Гливенко — Кантелли иногда называется «основной теоремой математической статистики», так как она устанавливает принципиальную возможность оценивания распределения по выборке.
- В вычислительной статистике для построения эмпирической функции распределения используются алгоритмы сортировки, наиболее эффективные из которых имеют сложность \( O(n \log n) \).
Источники
- Боровков А. А. Математическая статистика: Оценка параметров, проверка гипотез. — М.: Физматлит, 2007.
- Ван дер Варден Б. Л. Математическая статистика. — М.: Издательство иностранной литературы, 1960.
- Кендалл М. Дж., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973.
- Ширяев А. Н. Вероятность. — М.: МЦНМО, 2011.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →