Доверительный интервал
Доверительный интервал — это статистический интервал, построенный по выборочным данным, который с заданной вероятностью (называемой доверительной вероятностью) накрывает истинное значение неизвестного параметра генеральной совокупности. Доверительный интервал является одним из основных инструментов интервального оценивания в математической статистике, позволяя перейти от точечной оценки (одного числа) к диапазону возможных значений, учитывающему случайную ошибку выборки.
Определение и основные понятия
Пусть имеется генеральная совокупность, распределение которой зависит от неизвестного параметра θ (например, среднего значения μ или дисперсии σ²). По выборке объема n строится интервал (L, U), где L и U — случайные величины (функции от выборки). Если для любого истинного значения θ выполняется условие:
P(L < θ < U) = 1 — α,
то интервал (L, U) называется доверительным интервалом для параметра θ с доверительной вероятностью (или уровнем доверия) 1 — α. Величина α называется уровнем значимости и обычно выбирается равной 0,05, 0,01 или 0,1.
- Доверительная вероятность (1 — α) — это вероятность того, что построенный интервал накроет истинное значение параметра. Например, при α = 0,05 доверительная вероятность составляет 0,95 (95%).
- Границы доверительного интервала — нижняя (L) и верхняя (U) случайные границы, которые вычисляются по данным выборки.
- Точность оценки — половина ширины доверительного интервала (U — L)/2. Чем уже интервал, тем точнее оценка.
Важно понимать, что доверительный интервал относится не к фиксированному значению параметра (которое неизвестно, но является константой), а к процедуре построения. Если многократно повторять эксперимент и каждый раз строить 95%-й доверительный интервал, то в 95% случаев эти интервалы будут содержать истинное значение параметра, а в 5% — нет.
История
Идея интервального оценивания восходит к работам Пьера-Симона Лапласа и Карла Фридриха Гаусса, которые использовали вероятностные границы для ошибок измерений. Однако современная концепция доверительного интервала была разработана польским математиком Ежи Нейманом в 1930-х годах. Нейман предложил строгую частотную интерпретацию, противопоставив её байесовским подходам, где используются априорные распределения. Его работа «О двух различных аспектах статистической оценки» (1937) заложила основы теории доверительных интервалов, которая стала стандартом в прикладной статистике.
Виды доверительных интервалов
Доверительные интервалы строятся для различных параметров и в зависимости от условий задачи.
По оцениваемому параметру
- Для среднего значения (μ). Наиболее распространённый тип. Используется, когда нужно оценить среднее значение признака в генеральной совокупности.
- Для дисперсии (σ²) и стандартного отклонения (σ). Применяется для оценки разброса данных.
- Для доли (p). Используется для оценки вероятности события или доли единиц с определённым признаком в генеральной совокупности.
- Для разности средних (μ₁ — μ₂). Сравнение двух групп.
- Для разности долей (p₁ — p₂). Сравнение долей в двух группах.
- Для коэффициента корреляции (ρ). Оценка силы и направления связи между переменными.
- Для параметров регрессионных моделей (например, коэффициентов наклона в линейной регрессии).
По методу построения
- Параметрические интервалы. Основаны на предположении о виде распределения генеральной совокупности (например, нормальное распределение). Для их построения используются известные распределения статистик (t-распределение Стьюдента, χ²-распределение, F-распределение Фишера).
- Непараметрические интервалы. Не требуют предположений о распределении. Примеры: бутстреп-интервалы (основанные на многократном перевыборе данных), интервалы на основе порядковых статистик (например, для медианы).
По условиям применения
- Для известной дисперсии. Редкий случай на практике, чаще используется в теоретических задачах. Строится с помощью нормального распределения (Z-статистика).
- Для неизвестной дисперсии. Стандартный случай. Используется t-распределение Стьюдента с n-1 степенями свободы.
- Для больших выборок (n ≥ 30). По центральной предельной теореме распределение выборочного среднего приближается к нормальному, поэтому часто используют Z-статистику, даже если дисперсия неизвестна (оценивая её по выборке).
- Для малых выборок (n < 30). Требуется предположение о нормальности распределения генеральной совокупности. Используется t-распределение Стьюдента.
Методы построения
Доверительный интервал для среднего (нормальное распределение, неизвестная дисперсия)
Это наиболее часто используемый случай. Формула имеет вид:
\[ \bar{x} \pm t_{\alpha/2, n-1} \cdot \frac{s}{\sqrt{n}} \]
где:
- \(\bar{x}\) — выборочное среднее;
- \(t_{\alpha/2, n-1}\) — квантиль t-распределения Стьюдента с n-1 степенями свободы, соответствующий уровню значимости α (двусторонний);
- \(s\) — выборочное стандартное отклонение;
- \(n\) — объём выборки.
Величина \(\frac{s}{\sqrt{n}}\) называется стандартной ошибкой среднего.
Доверительный интервал для доли (большая выборка)
Для биномиального распределения при n ≥ 30 и np ≥ 5, n(1-p) ≥ 5 используется приближение к нормальному распределению:
\[ \hat{p} \pm z_{\alpha/2} \cdot \sqrt{\frac{\hat{p}(1-\hat{p})}{n}} \]
где:
- \(\hat{p}\) — выборочная доля;
- \(z_{\alpha/2}\) — квантиль стандартного нормального распределения (например, для 95% интервала \(z_{0.025} \approx 1.96\)).
Доверительный интервал для дисперсии (нормальное распределение)
Строится с использованием χ²-распределения:
\[ \left( \frac{(n-1)s^2}{\chi^2_{\alpha/2, n-1}}, \frac{(n-1)s^2}{\chi^2_{1-\alpha/2, n-1}} \right) \]
где \(\chi^2_{\alpha/2, n-1}\) — квантиль χ²-распределения с n-1 степенями свободы.
Интерпретация и распространённые ошибки
- Правильная интерпретация: «Если мы многократно будем брать выборки объёмом n и для каждой строить 95%-й доверительный интервал, то 95% таких интервалов будут содержать истинное среднее значение генеральной совокупности».
- Неправильная интерпретация: «Вероятность того, что истинное среднее лежит в данном конкретном интервале, равна 95%». В частотной статистике параметр — это фиксированная константа, а не случайная величина. Поэтому вероятность относится к процедуре, а не к конкретному интервалу.
- Смешение с доверительным интервалом для прогноза: Доверительный интервал для среднего (среднее значение группы) и интервал для прогноза (индивидуальное значение) — разные понятия. Интервал для прогноза всегда шире, так как включает дополнительную неопределённость индивидуального разброса.
Применение
Доверительные интервалы широко используются в различных областях:
- Медицина и эпидемиология: оценка эффективности лекарств (например, разница в выздоровлении между группами), расчёт относительного риска и отношения шансов.
- Экономика и финансы: прогнозирование доходности активов, оценка инфляции, анализ рынка труда.
- Социология и маркетинг: опросы общественного мнения, оценка доли респондентов, поддерживающих кандидата, анализ потребительских предпочтений.
- Инженерия и контроль качества: оценка точности измерительных приборов, определение границ допусков для продукции.
- Экология и биология: оценка численности популяций, анализ загрязнения окружающей среды.
Связь с проверкой статистических гипотез
Доверительный интервал и проверка гипотез тесно связаны. Если нулевое значение (например, μ = 0) не попадает в 95%-й доверительный интервал для μ, то нулевая гипотеза отвергается на уровне значимости α = 0,05. Двусторонний доверительный интервал с уровнем 1 — α эквивалентен двусторонней проверке гипотезы с уровнем α. Это позволяет не только принять или отвергнуть гипотезу, но и оценить величину эффекта (размер разницы).
Критика и ограничения
- Зависимость от объёма выборки: При малых выборках интервалы становятся широкими, что снижает практическую ценность оценки.
- Чувствительность к нарушению предположений: Параметрические интервалы (особенно для малых выборок) сильно зависят от нормальности распределения. При её нарушении фактические вероятности покрытия могут отличаться от номинальных.
- Частотная интерпретация: Для практиков часто интуитивно более понятен байесовский подход (кредибельный интервал), который позволяет говорить о вероятности нахождения параметра в интервале. Однако доверительные интервалы остаются стандартом в большинстве научных публикаций.
- Проблема множественных сравнений: При построении большого числа доверительных интервалов (например, для многих подгрупп) вероятность того, что хотя бы один из них не накроет истинное значение, возрастает. Для коррекции применяются поправки (например, Бонферрони).
Источники
- Нейман, Е. (1937). О двух различных аспектах статистической оценки. Philosophical Transactions of the Royal Society of London. Series A, Mathematical and Physical Sciences.
- Кендалл, М., Стьюарт, А. (1973). Статистические выводы и связи. Наука.
- Гмурман, В. Е. (2004). Теория вероятностей и математическая статистика. Высшая школа.
- Лемешко, Б. Ю. (2015). Статистический анализ данных. Издательство НГТУ.
- Altman, D. G., Machin, D., Bryant, T. N., Gardner, M. J. (2000). Statistics with Confidence: Confidence Intervals and Statistical Guidelines. BMJ Books.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →