Стандартное нормальное распределение
Стандартное нормальное распределение (также стандартное гауссово распределение, Z-распределение) — это непрерывное распределение вероятностей, являющееся частным случаем нормального распределения с математическим ожиданием, равным 0, и дисперсией, равной 1. Оно служит эталонной моделью для описания случайных величин, возникающих в результате суммирования большого числа независимых, одинаково распределённых случайных факторов (согласно центральной предельной теореме), и широко применяется в статистике, теории вероятностей, физике и других науках для стандартизации данных и расчёта вероятностей.
Определение и свойства
Стандартное нормальное распределение задаётся функцией плотности вероятности:
\[ \phi(z) = \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}}, \]
где \( z \) — действительное число (\( -\infty < z < \infty \)). Функция распределения (интегральная функция вероятности) выражается через интеграл:
\[ \Phi(z) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{z} e^{-\frac{t^2}{2}} dt. \]
Основные характеристики
- Математическое ожидание: \( \mu = 0 \).
- Дисперсия: \( \sigma^2 = 1 \).
- Стандартное отклонение: \( \sigma = 1 \).
- Медиана: \( 0 \).
- Мода: \( 0 \).
- Коэффициент асимметрии: 0 (распределение симметрично относительно нуля).
- Коэффициент эксцесса: 3 (избыточный эксцесс равен 0, что соответствует нормальному распределению).
Свойства
- Симметричность: график плотности симметричен относительно вертикальной оси \( z = 0 \).
- Колоколообразная форма: функция плотности достигает максимума в точке \( z = 0 \) (значение \( \phi(0) \approx 0.3989 \)) и убывает к нулю при удалении от центра.
- Правило трёх сигм: для стандартного нормального распределения вероятность попадания случайной величины в интервал \([-1, 1]\) составляет около 68.27%, в интервал \([-2, 2]\) — около 95.45%, в интервал \([-3, 3]\) — около 99.73%. Эти значения следуют из свойств нормального распределения.
- Линейное преобразование: если случайная величина \( X \) имеет нормальное распределение с параметрами \( \mu \) и \( \sigma^2 \), то величина \( Z = \frac{X - \mu}{\sigma} \) имеет стандартное нормальное распределение. Это свойство лежит в основе стандартизации данных.
История
Нормальное распределение впервые было описано в XVIII веке. В 1733 году Абрахам де Муавр вывел его как аппроксимацию биномиального распределения для большого числа испытаний. В начале XIX века Пьер-Симон Лаплас и Карл Фридрих Гаусс независимо друг от друга развили теорию нормального распределения. Гаусс использовал его для анализа ошибок астрономических наблюдений, что привело к названию «гауссово распределение». Стандартная форма с нулевым средним и единичной дисперсией стала общепринятой благодаря работам статистиков XX века, в частности Рональда Фишера, который ввёл стандартизацию как метод для упрощения статистических вычислений.
Таблицы и квантили
Поскольку интеграл функции плотности не выражается в элементарных функциях, для практических расчётов используются таблицы значений функции распределения \( \Phi(z) \) и её обратной функции — квантилей. Квантиль уровня \( p \) (где \( 0 < p < 1 \)) — это такое значение \( z_p \), что \( \Phi(z_p) = p \). Наиболее часто используемые квантили:
- \( z_{0.5} = 0 \) (медиана).
- \( z_{0.9} \approx 1.2816 \).
- \( z_{0.95} \approx 1.6449 \).
- \( z_{0.975} \approx 1.9600 \).
- \( z_{0.99} \approx 2.3263 \).
- \( z_{0.995} \approx 2.5758 \).
Эти значения применяются при построении доверительных интервалов и проверке статистических гипотез. В современных статистических пакетах и языках программирования (например, R, Python, MATLAB) расчёт квантилей и вероятностей выполняется автоматически.
Применение
Статистика и анализ данных
Стандартное нормальное распределение является основой для многих статистических методов. Оно используется для:
- Стандартизации данных: преобразование исходных значений в Z-оценки (z-скор) позволяет сравнивать наблюдения из разных распределений. Z-оценка вычисляется как \( z = \frac{x - \mu}{\sigma} \), где \( x \) — исходное значение, \( \mu \) и \( \sigma \) — среднее и стандартное отклонение выборки или генеральной совокупности.
- Проверки гипотез: Z-тест (критерий) применяется для проверки гипотез о среднем значении, когда дисперсия известна или объём выборки велик. Статистика теста имеет стандартное нормальное распределение при нулевой гипотезе.
- Построения доверительных интервалов: для среднего значения при известной дисперсии используется квантиль стандартного нормального распределения (например, 1.96 для 95% доверительного интервала).
- Оценки вероятностей: с помощью таблиц или программного обеспечения вычисляется вероятность попадания случайной величины в заданный интервал.
Другие области
- Физика: описание случайных ошибок измерений, распределение скоростей молекул в идеальном газе (распределение Максвелла) и другие процессы, подчиняющиеся закону больших чисел.
- Биология и медицина: моделирование роста, веса, артериального давления и других биометрических показателей в популяциях.
- Финансы: оценка рисков, моделирование доходности активов, расчёт Value at Risk (VaR) на основе предположения о нормальном распределении.
- Инженерия: контроль качества продукции, анализ допусков и надёжности.
Связь с другими распределениями
Стандартное нормальное распределение является предельным случаем для многих других распределений:
- Распределение Стьюдента: при увеличении числа степеней свободы распределение Стьюдента стремится к стандартному нормальному.
- Биномиальное распределение: при большом числе испытаний и вероятности успеха, не близкой к 0 или 1, биномиальное распределение аппроксимируется нормальным (с учётом поправки на непрерывность).
- Распределение хи-квадрат: квадрат стандартной нормальной случайной величины имеет распределение хи-квадрат с одной степенью свободы.
- Распределение Лапласа: отличается более тяжёлыми хвостами, но при определённых условиях может быть аппроксимировано нормальным.
Критика и ограничения
Хотя стандартное нормальное распределение широко используется, его применение основано на ряде допущений, которые не всегда выполняются на практике:
- Предположение о нормальности: многие реальные данные не подчиняются нормальному распределению (например, имеют асимметрию или выбросы). В таких случаях стандартизация и Z-тесты могут давать некорректные результаты.
- Чувствительность к выбросам: Z-оценки сильно зависят от выбросов, так как среднее и стандартное отклонение не являются робастными оценками.
- Центральная предельная теорема: для малых выборок (менее 30 наблюдений) распределение выборочного среднего может значительно отличаться от нормального, особенно если исходное распределение сильно асимметрично.
Для преодоления этих ограничений используются робастные методы (например, медиана и межквартильный размах), непараметрические критерии (например, критерий Манна-Уитни) или преобразования данных (логарифмическое, степенное).
Интересные факты
- Стандартное нормальное распределение иногда называют «Z-распределением» из-за обозначения переменной \( z \).
- В русскоязычной литературе для обозначения функции распределения стандартного нормального распределения часто используется символ \( \Phi(x) \) (в честь Лапласа), а в англоязычной — \( \Phi(z) \).
- В статистических пакетах и языках программирования стандартное нормальное распределение обычно реализовано как встроенная функция (например,
dnorm,pnorm,qnormв R,norm.pdfв Python).
Источники
- Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшая школа, 2003.
- Кремер Н. Ш. Теория вероятностей и математическая статистика. — М.: ЮНИТИ-ДАНА, 2004.
- Вентцель Е. С. Теория вероятностей. — М.: Наука, 1969.
- Большев Л. Н., Смирнов Н. В. Таблицы математической статистики. — М.: Наука, 1983.
- Математическая энциклопедия / Гл. ред. И. М. Виноградов. — М.: Советская энциклопедия, 1977–1985.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →