Открыть сервис

Стандартное нормальное распределение

Стандартное нормальное распределение (также стандартное гауссово распределение, Z-распределение) — это непрерывное распределение вероятностей, являющееся частным случаем нормального распределения с математическим ожиданием, равным 0, и дисперсией, равной 1. Оно служит эталонной моделью для описания случайных величин, возникающих в результате суммирования большого числа независимых, одинаково распределённых случайных факторов (согласно центральной предельной теореме), и широко применяется в статистике, теории вероятностей, физике и других науках для стандартизации данных и расчёта вероятностей.

Определение и свойства

Стандартное нормальное распределение задаётся функцией плотности вероятности:

\[ \phi(z) = \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}}, \]

где \( z \) — действительное число (\( -\infty < z < \infty \)). Функция распределения (интегральная функция вероятности) выражается через интеграл:

\[ \Phi(z) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{z} e^{-\frac{t^2}{2}} dt. \]

Основные характеристики

Свойства

  1. Симметричность: график плотности симметричен относительно вертикальной оси \( z = 0 \).
  2. Колоколообразная форма: функция плотности достигает максимума в точке \( z = 0 \) (значение \( \phi(0) \approx 0.3989 \)) и убывает к нулю при удалении от центра.
  3. Правило трёх сигм: для стандартного нормального распределения вероятность попадания случайной величины в интервал \([-1, 1]\) составляет около 68.27%, в интервал \([-2, 2]\) — около 95.45%, в интервал \([-3, 3]\) — около 99.73%. Эти значения следуют из свойств нормального распределения.
  4. Линейное преобразование: если случайная величина \( X \) имеет нормальное распределение с параметрами \( \mu \) и \( \sigma^2 \), то величина \( Z = \frac{X - \mu}{\sigma} \) имеет стандартное нормальное распределение. Это свойство лежит в основе стандартизации данных.

История

Нормальное распределение впервые было описано в XVIII веке. В 1733 году Абрахам де Муавр вывел его как аппроксимацию биномиального распределения для большого числа испытаний. В начале XIX века Пьер-Симон Лаплас и Карл Фридрих Гаусс независимо друг от друга развили теорию нормального распределения. Гаусс использовал его для анализа ошибок астрономических наблюдений, что привело к названию «гауссово распределение». Стандартная форма с нулевым средним и единичной дисперсией стала общепринятой благодаря работам статистиков XX века, в частности Рональда Фишера, который ввёл стандартизацию как метод для упрощения статистических вычислений.

Таблицы и квантили

Поскольку интеграл функции плотности не выражается в элементарных функциях, для практических расчётов используются таблицы значений функции распределения \( \Phi(z) \) и её обратной функции — квантилей. Квантиль уровня \( p \) (где \( 0 < p < 1 \)) — это такое значение \( z_p \), что \( \Phi(z_p) = p \). Наиболее часто используемые квантили:

  • \( z_{0.5} = 0 \) (медиана).
  • \( z_{0.9} \approx 1.2816 \).
  • \( z_{0.95} \approx 1.6449 \).
  • \( z_{0.975} \approx 1.9600 \).
  • \( z_{0.99} \approx 2.3263 \).
  • \( z_{0.995} \approx 2.5758 \).

Эти значения применяются при построении доверительных интервалов и проверке статистических гипотез. В современных статистических пакетах и языках программирования (например, R, Python, MATLAB) расчёт квантилей и вероятностей выполняется автоматически.

Применение

Статистика и анализ данных

Стандартное нормальное распределение является основой для многих статистических методов. Оно используется для:

  • Стандартизации данных: преобразование исходных значений в Z-оценки (z-скор) позволяет сравнивать наблюдения из разных распределений. Z-оценка вычисляется как \( z = \frac{x - \mu}{\sigma} \), где \( x \) — исходное значение, \( \mu \) и \( \sigma \) — среднее и стандартное отклонение выборки или генеральной совокупности.
  • Проверки гипотез: Z-тест (критерий) применяется для проверки гипотез о среднем значении, когда дисперсия известна или объём выборки велик. Статистика теста имеет стандартное нормальное распределение при нулевой гипотезе.
  • Построения доверительных интервалов: для среднего значения при известной дисперсии используется квантиль стандартного нормального распределения (например, 1.96 для 95% доверительного интервала).
  • Оценки вероятностей: с помощью таблиц или программного обеспечения вычисляется вероятность попадания случайной величины в заданный интервал.

Другие области

  • Физика: описание случайных ошибок измерений, распределение скоростей молекул в идеальном газе (распределение Максвелла) и другие процессы, подчиняющиеся закону больших чисел.
  • Биология и медицина: моделирование роста, веса, артериального давления и других биометрических показателей в популяциях.
  • Финансы: оценка рисков, моделирование доходности активов, расчёт Value at Risk (VaR) на основе предположения о нормальном распределении.
  • Инженерия: контроль качества продукции, анализ допусков и надёжности.

Связь с другими распределениями

Стандартное нормальное распределение является предельным случаем для многих других распределений:

  • Распределение Стьюдента: при увеличении числа степеней свободы распределение Стьюдента стремится к стандартному нормальному.
  • Биномиальное распределение: при большом числе испытаний и вероятности успеха, не близкой к 0 или 1, биномиальное распределение аппроксимируется нормальным (с учётом поправки на непрерывность).
  • Распределение хи-квадрат: квадрат стандартной нормальной случайной величины имеет распределение хи-квадрат с одной степенью свободы.
  • Распределение Лапласа: отличается более тяжёлыми хвостами, но при определённых условиях может быть аппроксимировано нормальным.

Критика и ограничения

Хотя стандартное нормальное распределение широко используется, его применение основано на ряде допущений, которые не всегда выполняются на практике:

  • Предположение о нормальности: многие реальные данные не подчиняются нормальному распределению (например, имеют асимметрию или выбросы). В таких случаях стандартизация и Z-тесты могут давать некорректные результаты.
  • Чувствительность к выбросам: Z-оценки сильно зависят от выбросов, так как среднее и стандартное отклонение не являются робастными оценками.
  • Центральная предельная теорема: для малых выборок (менее 30 наблюдений) распределение выборочного среднего может значительно отличаться от нормального, особенно если исходное распределение сильно асимметрично.

Для преодоления этих ограничений используются робастные методы (например, медиана и межквартильный размах), непараметрические критерии (например, критерий Манна-Уитни) или преобразования данных (логарифмическое, степенное).

Интересные факты

  • Стандартное нормальное распределение иногда называют «Z-распределением» из-за обозначения переменной \( z \).
  • В русскоязычной литературе для обозначения функции распределения стандартного нормального распределения часто используется символ \( \Phi(x) \) (в честь Лапласа), а в англоязычной — \( \Phi(z) \).
  • В статистических пакетах и языках программирования стандартное нормальное распределение обычно реализовано как встроенная функция (например, dnorm, pnorm, qnorm в R, norm.pdf в Python).

Источники

  • Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшая школа, 2003.
  • Кремер Н. Ш. Теория вероятностей и математическая статистика. — М.: ЮНИТИ-ДАНА, 2004.
  • Вентцель Е. С. Теория вероятностей. — М.: Наука, 1969.
  • Большев Л. Н., Смирнов Н. В. Таблицы математической статистики. — М.: Наука, 1983.
  • Математическая энциклопедия / Гл. ред. И. М. Виноградов. — М.: Советская энциклопедия, 1977–1985.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →