Распределение вероятностей
Распределение вероятностей — это математическая функция или закон, который описывает возможные значения случайной величины и соответствующие им вероятности. В теории вероятностей и математической статистике распределение вероятностей является фундаментальным понятием, позволяющим количественно оценивать случайные события и явления. Распределение задаётся либо в виде таблицы, формулы, графика, либо через функцию распределения или плотность вероятности. Различают дискретные и непрерывные распределения, а также их многомерные обобщения.
Основные понятия
Случайная величина
Случайная величина — это переменная, значения которой зависят от исхода случайного эксперимента. Она может быть дискретной (принимающей конечное или счётное множество значений, например, число выпавших орлов при подбрасывании монеты) или непрерывной (принимающей любые значения из некоторого интервала, например, рост человека). Для каждой случайной величины существует своё распределение вероятностей.
Функция распределения
Функция распределения случайной величины \(X\) определяется как \(F(x) = P(X \le x)\), где \(P\) — вероятность. Она является неубывающей, непрерывной справа и стремится к 0 при \(x \to -\infty\) и к 1 при \(x \to +\infty\). Для дискретных величин функция распределения имеет ступенчатый вид, для непрерывных — непрерывна.
Плотность вероятности
Для непрерывных случайных величин используется плотность вероятности \(f(x)\), которая является производной функции распределения: \(f(x) = F'(x)\). Плотность неотрицательна, и площадь под её графиком равна 1. Вероятность попадания случайной величины в интервал \([a, b]\) равна интегралу плотности по этому интервалу.
Классификация распределений
Дискретные распределения
Дискретные распределения описывают случайные величины, принимающие изолированные значения. Основные характеристики: ряд распределения (таблица значений и вероятностей), математическое ожидание, дисперсия.
- Распределение Бернулли — модель единичного испытания с двумя исходами (успех/неудача). Параметр: вероятность успеха \(p\).
- Биномиальное распределение — число успехов в \(n\) независимых испытаниях Бернулли. Параметры: \(n\) и \(p\).
- Распределение Пуассона — число редких событий за фиксированный промежуток времени. Параметр: среднее число событий \(\lambda\). Применяется в теории массового обслуживания, страховании.
- Геометрическое распределение — число испытаний до первого успеха. Параметр: \(p\).
- Гипергеометрическое распределение — число успехов при выборе без возвращения из конечной совокупности.
Непрерывные распределения
Непрерывные распределения описывают величины, которые могут принимать любые значения из интервала. Основные характеристики: плотность вероятности, функция распределения, моменты.
- Равномерное распределение — все значения в интервале \([a, b]\) равновероятны. Плотность: \(f(x) = 1/(b-a)\).
- Нормальное распределение (Гаусса) — одно из важнейших в статистике. Плотность: \(f(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x-\mu)^2}{2\sigma^2}}\), где \(\mu\) — математическое ожидание, \(\sigma\) — стандартное отклонение. Согласно центральной предельной теореме, сумма большого числа независимых случайных величин стремится к нормальному распределению.
- Экспоненциальное распределение — описывает промежутки времени между независимыми событиями. Параметр: интенсивность \(\lambda\). Используется в теории надёжности.
- Распределение Стьюдента (t-распределение) — применяется при малых выборках для оценки среднего. Параметр: число степеней свободы.
- Распределение хи-квадрат — сумма квадратов независимых стандартных нормальных величин. Используется в критериях согласия.
- Распределение Фишера (F-распределение) — отношение двух независимых хи-квадрат величин. Применяется в дисперсионном анализе.
Многомерные распределения
Многомерные распределения описывают совместное поведение нескольких случайных величин. Например, многомерное нормальное распределение задаётся вектором средних и ковариационной матрицей. Для анализа зависимостей используются ковариация и коэффициент корреляции.
Характеристики распределений
Математическое ожидание
Математическое ожидание (среднее значение) — центр распределения. Для дискретной величины: \(E[X] = \sum x_i p_i\). Для непрерывной: \(E[X] = \int_{-\infty}^{\infty} x f(x) dx\).
Дисперсия и стандартное отклонение
Дисперсия \(Var(X) = E[(X - E[X])^2]\) характеризует разброс значений относительно среднего. Стандартное отклонение \(\sigma = \sqrt{Var(X)}\) имеет ту же размерность, что и случайная величина.
Моменты
Моменты высших порядков (асимметрия, эксцесс) описывают форму распределения. Асимметрия показывает скошенность, эксцесс — «островершинность».
Квантили
Квантиль — значение, ниже которого вероятность равна заданному уровню \(q\). Медиана — квантиль уровня 0.5. Квартили, децили, процентили используются в описательной статистике.
Применение распределений вероятностей
В статистике
Распределения лежат в основе статистического вывода: проверки гипотез, построения доверительных интервалов, регрессионного анализа. Например, нормальное распределение используется в t-тесте, распределение хи-квадрат — в критерии Пирсона.
В естественных науках
В физике распределение Максвелла описывает скорости молекул газа, распределение Больцмана — энергии частиц. В биологии — распределение Пуассона для числа мутаций.
В экономике и финансах
Логнормальное распределение моделирует цены активов. Распределение Парето — распределение доходов. В управлении рисками используются хвостовые распределения (например, распределение Вейбулла).
В технике и инженерии
В теории надёжности — экспоненциальное и распределение Вейбулла для времени безотказной работы. В теории массового обслуживания — распределение Пуассона для потоков заявок.
В машинном обучении
Распределения вероятностей используются в байесовских методах, генеративных моделях (например, вариационные автокодировщики), при оценке неопределённости прогнозов.
Методы оценки распределений
Эмпирическое распределение
По выборке строится эмпирическая функция распределения, которая сходится к теоретической при увеличении объёма выборки (теорема Гливенко — Кантелли).
Параметрические методы
Предполагается, что распределение принадлежит известному семейству (например, нормальному), и оцениваются его параметры (метод моментов, метод максимального правдоподобия).
Непараметрические методы
Не требуют априорных предположений о виде распределения. Примеры: ядерное сглаживание, оценка плотности методом гистограмм.
Интересные факты
- Понятие распределения вероятностей впервые систематически исследовал Пьер-Симон Лаплас в конце XVIII — начале XIX века.
- Нормальное распределение также называют «колоколообразной кривой» из-за формы графика плотности.
- В России и странах бывшего СССР значительный вклад в теорию распределений внесли А. Н. Колмогоров, А. Я. Хинчин, Б. В. Гнеденко.
- Существуют распределения с бесконечной дисперсией (например, распределение Коши), что делает их неприменимыми в классической статистике.
- Закон больших чисел и центральная предельная теорема являются теоретической основой для использования распределений в прикладных задачах.
Критика и ограничения
- Многие реальные данные не подчиняются идеализированным распределениям (например, финансовые ряды часто имеют «тяжёлые хвосты»).
- Параметрические методы могут давать неверные результаты при нарушении предположений о виде распределения.
- Оценка распределения по малым выборкам сопряжена с высокой неопределённостью.
Источники
- Гнеденко Б. В. «Курс теории вероятностей». — М.: Наука, 1988.
- Колмогоров А. Н. «Основные понятия теории вероятностей». — М.: Наука, 1974.
- Ширяев А. Н. «Вероятность». — М.: Наука, 1989.
- Вентцель Е. С. «Теория вероятностей». — М.: Высшая школа, 2006.
- Feller W. «An Introduction to Probability Theory and Its Applications». — Wiley, 1968.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →