Открыть сервис

Доверительный интервал

Доверительный интервал — это статистический интервал, построенный по выборочным данным, который с заданной вероятностью (называемой доверительной вероятностью) накрывает истинное значение неизвестного параметра генеральной совокупности. Доверительный интервал является одним из основных инструментов интервального оценивания в математической статистике, позволяя перейти от точечной оценки (одного числа) к диапазону возможных значений, учитывающему случайную ошибку выборки.

Определение и основные понятия

Пусть имеется генеральная совокупность, распределение которой зависит от неизвестного параметра θ (например, среднего значения μ или дисперсии σ²). По выборке объема n строится интервал (L, U), где L и U — случайные величины (функции от выборки). Если для любого истинного значения θ выполняется условие:

P(L < θ < U) = 1 — α,

то интервал (L, U) называется доверительным интервалом для параметра θ с доверительной вероятностью (или уровнем доверия) 1 — α. Величина α называется уровнем значимости и обычно выбирается равной 0,05, 0,01 или 0,1.

  • Доверительная вероятность (1 — α) — это вероятность того, что построенный интервал накроет истинное значение параметра. Например, при α = 0,05 доверительная вероятность составляет 0,95 (95%).
  • Границы доверительного интервала — нижняя (L) и верхняя (U) случайные границы, которые вычисляются по данным выборки.
  • Точность оценки — половина ширины доверительного интервала (U — L)/2. Чем уже интервал, тем точнее оценка.

Важно понимать, что доверительный интервал относится не к фиксированному значению параметра (которое неизвестно, но является константой), а к процедуре построения. Если многократно повторять эксперимент и каждый раз строить 95%-й доверительный интервал, то в 95% случаев эти интервалы будут содержать истинное значение параметра, а в 5% — нет.

История

Идея интервального оценивания восходит к работам Пьера-Симона Лапласа и Карла Фридриха Гаусса, которые использовали вероятностные границы для ошибок измерений. Однако современная концепция доверительного интервала была разработана польским математиком Ежи Нейманом в 1930-х годах. Нейман предложил строгую частотную интерпретацию, противопоставив её байесовским подходам, где используются априорные распределения. Его работа «О двух различных аспектах статистической оценки» (1937) заложила основы теории доверительных интервалов, которая стала стандартом в прикладной статистике.

Виды доверительных интервалов

Доверительные интервалы строятся для различных параметров и в зависимости от условий задачи.

По оцениваемому параметру

  1. Для среднего значения (μ). Наиболее распространённый тип. Используется, когда нужно оценить среднее значение признака в генеральной совокупности.
  2. Для дисперсии (σ²) и стандартного отклонения (σ). Применяется для оценки разброса данных.
  3. Для доли (p). Используется для оценки вероятности события или доли единиц с определённым признаком в генеральной совокупности.
  4. Для разности средних (μ₁ — μ₂). Сравнение двух групп.
  5. Для разности долей (p₁ — p₂). Сравнение долей в двух группах.
  6. Для коэффициента корреляции (ρ). Оценка силы и направления связи между переменными.
  7. Для параметров регрессионных моделей (например, коэффициентов наклона в линейной регрессии).

По методу построения

  1. Параметрические интервалы. Основаны на предположении о виде распределения генеральной совокупности (например, нормальное распределение). Для их построения используются известные распределения статистик (t-распределение Стьюдента, χ²-распределение, F-распределение Фишера).
  2. Непараметрические интервалы. Не требуют предположений о распределении. Примеры: бутстреп-интервалы (основанные на многократном перевыборе данных), интервалы на основе порядковых статистик (например, для медианы).

По условиям применения

  1. Для известной дисперсии. Редкий случай на практике, чаще используется в теоретических задачах. Строится с помощью нормального распределения (Z-статистика).
  2. Для неизвестной дисперсии. Стандартный случай. Используется t-распределение Стьюдента с n-1 степенями свободы.
  3. Для больших выборок (n ≥ 30). По центральной предельной теореме распределение выборочного среднего приближается к нормальному, поэтому часто используют Z-статистику, даже если дисперсия неизвестна (оценивая её по выборке).
  4. Для малых выборок (n < 30). Требуется предположение о нормальности распределения генеральной совокупности. Используется t-распределение Стьюдента.

Методы построения

Доверительный интервал для среднего (нормальное распределение, неизвестная дисперсия)

Это наиболее часто используемый случай. Формула имеет вид:

\[ \bar{x} \pm t_{\alpha/2, n-1} \cdot \frac{s}{\sqrt{n}} \]

где:

Величина \(\frac{s}{\sqrt{n}}\) называется стандартной ошибкой среднего.

Доверительный интервал для доли (большая выборка)

Для биномиального распределения при n ≥ 30 и np ≥ 5, n(1-p) ≥ 5 используется приближение к нормальному распределению:

\[ \hat{p} \pm z_{\alpha/2} \cdot \sqrt{\frac{\hat{p}(1-\hat{p})}{n}} \]

где:

  • \(\hat{p}\) — выборочная доля;
  • \(z_{\alpha/2}\) — квантиль стандартного нормального распределения (например, для 95% интервала \(z_{0.025} \approx 1.96\)).

Доверительный интервал для дисперсии (нормальное распределение)

Строится с использованием χ²-распределения:

\[ \left( \frac{(n-1)s^2}{\chi^2_{\alpha/2, n-1}}, \frac{(n-1)s^2}{\chi^2_{1-\alpha/2, n-1}} \right) \]

где \(\chi^2_{\alpha/2, n-1}\) — квантиль χ²-распределения с n-1 степенями свободы.

Интерпретация и распространённые ошибки

  • Правильная интерпретация: «Если мы многократно будем брать выборки объёмом n и для каждой строить 95%-й доверительный интервал, то 95% таких интервалов будут содержать истинное среднее значение генеральной совокупности».
  • Неправильная интерпретация: «Вероятность того, что истинное среднее лежит в данном конкретном интервале, равна 95%». В частотной статистике параметр — это фиксированная константа, а не случайная величина. Поэтому вероятность относится к процедуре, а не к конкретному интервалу.
  • Смешение с доверительным интервалом для прогноза: Доверительный интервал для среднего (среднее значение группы) и интервал для прогноза (индивидуальное значение) — разные понятия. Интервал для прогноза всегда шире, так как включает дополнительную неопределённость индивидуального разброса.

Применение

Доверительные интервалы широко используются в различных областях:

  • Медицина и эпидемиология: оценка эффективности лекарств (например, разница в выздоровлении между группами), расчёт относительного риска и отношения шансов.
  • Экономика и финансы: прогнозирование доходности активов, оценка инфляции, анализ рынка труда.
  • Социология и маркетинг: опросы общественного мнения, оценка доли респондентов, поддерживающих кандидата, анализ потребительских предпочтений.
  • Инженерия и контроль качества: оценка точности измерительных приборов, определение границ допусков для продукции.
  • Экология и биология: оценка численности популяций, анализ загрязнения окружающей среды.

Связь с проверкой статистических гипотез

Доверительный интервал и проверка гипотез тесно связаны. Если нулевое значение (например, μ = 0) не попадает в 95%-й доверительный интервал для μ, то нулевая гипотеза отвергается на уровне значимости α = 0,05. Двусторонний доверительный интервал с уровнем 1 — α эквивалентен двусторонней проверке гипотезы с уровнем α. Это позволяет не только принять или отвергнуть гипотезу, но и оценить величину эффекта (размер разницы).

Критика и ограничения

  • Зависимость от объёма выборки: При малых выборках интервалы становятся широкими, что снижает практическую ценность оценки.
  • Чувствительность к нарушению предположений: Параметрические интервалы (особенно для малых выборок) сильно зависят от нормальности распределения. При её нарушении фактические вероятности покрытия могут отличаться от номинальных.
  • Частотная интерпретация: Для практиков часто интуитивно более понятен байесовский подход (кредибельный интервал), который позволяет говорить о вероятности нахождения параметра в интервале. Однако доверительные интервалы остаются стандартом в большинстве научных публикаций.
  • Проблема множественных сравнений: При построении большого числа доверительных интервалов (например, для многих подгрупп) вероятность того, что хотя бы один из них не накроет истинное значение, возрастает. Для коррекции применяются поправки (например, Бонферрони).

Источники

  1. Нейман, Е. (1937). О двух различных аспектах статистической оценки. Philosophical Transactions of the Royal Society of London. Series A, Mathematical and Physical Sciences.
  2. Кендалл, М., Стьюарт, А. (1973). Статистические выводы и связи. Наука.
  3. Гмурман, В. Е. (2004). Теория вероятностей и математическая статистика. Высшая школа.
  4. Лемешко, Б. Ю. (2015). Статистический анализ данных. Издательство НГТУ.
  5. Altman, D. G., Machin, D., Bryant, T. N., Gardner, M. J. (2000). Statistics with Confidence: Confidence Intervals and Statistical Guidelines. BMJ Books.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →