Открыть сервис

Среднеквадратичное отклонение в статистике

Среднеквадратичное отклонение (также стандартное отклонение, СКО) — статистический показатель, характеризующий рассеяние значений случайной величины относительно её среднего значения. Численно равно квадратному корню из дисперсии. Обозначается греческой буквой σ (сигма) для генеральной совокупности или латинской s для выборки. Является одной из ключевых мер разброса данных наряду с дисперсией, размахом и средним абсолютным отклонением.

Определение и формула

Для случайной величины X с математическим ожиданием μ среднеквадратичное отклонение определяется как:

σ = √(E[(X − μ)²])

где E — оператор математического ожидания. Для дискретной выборки объёмом n со значениями x₁, x₂, …, xₙ и выборочным средним x̄ используется формула:

s = √( Σ(xᵢ − x̄)² / (n − 1) )

Деление на (n − 1) вместо n даёт несмещённую оценку дисперсии генеральной совокупности (поправка Бесселя). При больших объёмах выборки разница между этими вариантами становится незначительной.

Смысл показателя

СКО измеряется в тех же единицах, что и сама случайная величина, что отличает его от дисперсии, выражаемой в квадратных единицах. Это делает показатель удобным для интерпретации: он показывает типичное отклонение отдельного наблюдения от среднего.

Для нормального распределения действует правило трёх сигм:

  • в интервал μ ± σ попадает около 68,3 % значений;
  • в интервал μ ± 2σ — около 95,4 %;
  • в интервал μ ± 3σ — около 99,7 %.

Эти соотношения широко применяются в статистическом контроле качества, метрологии и обработке экспериментальных данных.

Свойства

Основные свойства среднеквадратичного отклонения:

  • неотрицательно: σ ≥ 0, причём σ = 0 только если все значения одинаковы;
  • инвариантно к сдвигу: σ(X + c) = σ(X) для любой константы c;
  • масштабируется линейно: σ(kX) = |k| · σ(X);
  • для суммы независимых величин дисперсии складываются: σ²(X + Y) = σ²(X) + σ²(Y).

Последнее свойство лежит в основе теории ошибок и центральной предельной теоремы.

Применение

СКО используется в самых разных областях:

В инженерной практике советских и российских предприятий СКО traditionally применялось в системах статистического регулирования технологических процессов, в частности при построении контрольных карт Шухарта.

Связь с другими показателями

СКО тесно связано с коэффициентом вариации CV = σ / μ, который позволяет сравнивать разброс величин с разными средними. Также оно связано с ковариацией и корреляцией: коэффициент корреляции Пирсона выражается через ковариацию, нормированную на произведения СКО двух величин.

При отклонении распределения от нормального СКО сохраняет смысл меры рассеяния, но теряет прямую интерпретацию через проценты попадания в интервалы. В таких случаях дополнительно применяют квартили, медианное абсолютное отклонение, коэффициент асимметрии и эксцесс.

Выборочное и генеральное СКО

Следует различать генеральное СКО (параметр распределения, обычно неизвестный) и выборочное (статистика, вычисляемая по данным). Выборочное СКО — случайная величина, зависящая от выборки; его собственное стандартное отклонение называется стандартной ошибкой. Стандартная ошибка среднего рассчитывается как s / √n и уменьшается с ростом объёма выборки, что используется при построении доверительных интервалов и проверке гипотез.

История

Понятие восходит к работам Карла Фридриха Гаусса и Пьера-Симона Лапласа начала XIX века, связанным с методом наименьших квадратов и теорией ошибок наблюдений. Термин «стандартное отклонение» (standard deviation) ввёл в оборот английский статистик Карл Пирсон в 1894 году. В российской статистической традиции утвердился термин «среднеквадратичное отклонение», подчёркивающий способ усреднения — из квадратов отклонений.

Вычисление и программные средства

Ручной расчёт включает несколько шагов: нахождение среднего, вычисление отклонений, их возведение в квадрат, суммирование, деление на (n − 1) и извлечение корня. В электронных таблицах применяются функции СТАНДОТКЛОН.В и СТАНДОТКЛОН.Г (в русской версии Excel), в языке Python — numpy.std с параметром ddof, в среде R — функции sd и sqrt(var). Выбор между выборочной и генеральной формулой зависит от задачи: для описания имеющегося набора данных используют генеральную, для оценки по выборке — выборочную.

Ограничения

СКО чувствительно к выбросам: одно аномальное значение способно существенно увеличить показатель. Оно предполагает осмысленность среднего как центра распределения, что неверно для сильно скошенных данных. Поэтому при анализе распределений с тяжёлыми хвостами предпочтительнее робастные меры разброса.

Источники: учебники по теории вероятностей и математической статистике, справочные материалы по метрологии, документация библиотек numpy и R, работы К. Пирсона.