Открыть сервис

Накопленная частота

Накопленная частота (также кумулятивная частота) — это статистический показатель, представляющий собой сумму частот всех значений признака, не превышающих данное значение, в упорядоченном ряду распределения. Накопленная частота используется для анализа распределения данных, построения кумулятивных кривых (огив) и расчёта квантилей, таких как медиана, квартили и перцентили. В отличие от простой частоты, которая показывает, сколько раз встречается конкретное значение, накопленная частота отражает общее количество наблюдений, попавших в интервал от минимального значения до текущего включительно.

Определение и основные понятия

В статистике частота (абсолютная частота) — это число повторений определённого значения или интервала значений в выборке. Накопленная частота для данного значения вычисляется как сумма частот всех значений, которые меньше или равны ему. Формально, для упорядоченного ряда значений \(x_1, x_2, \dots, x_k\) с соответствующими частотами \(f_1, f_2, \dots, f_k\) накопленная частота \(F_i\) для значения \(x_i\) определяется как:

\[ F_i = \sum_{j=1}^{i} f_j \]

где \(i\) — номер значения в порядке возрастания. Таким образом, накопленная частота для последнего значения в ряду равна общему объёму выборки \(N\).

Наряду с абсолютными накопленными частотами часто используют относительные накопленные частоты (кумулятивные относительные частоты), которые выражаются в долях или процентах от общего числа наблюдений. Они вычисляются как отношение абсолютной накопленной частоты к объёму выборки: \(F_i / N\). Относительные накопленные частоты позволяют сравнивать распределения разных выборок независимо от их размера.

Пример расчёта

Рассмотрим простой пример: пусть имеются данные о количестве детей в 20 семьях: 0, 1, 1, 2, 2, 2, 3, 3, 3, 3, 4, 4, 4, 5, 5, 6, 6, 7, 8, 9. Построим таблицу распределения частот и накопленных частот.

Количество детей (x)Частота (f)Накопленная частота (F)Относительная накопленная частота
0110,05 (5%)
1230,15 (15%)
2360,30 (30%)
34100,50 (50%)
43130,65 (65%)
52150,75 (75%)
62170,85 (85%)
71180,90 (90%)
81190,95 (95%)
91201,00 (100%)

Из таблицы видно, что, например, накопленная частота для значения 3 равна 10, что означает, что 10 семей имеют 3 детей или меньше. Относительная накопленная частота 0,50 (50%) для значения 3 указывает, что половина семей имеет не более 3 детей.

Графическое представление

Накопленные частоты визуализируются с помощью кумулятивной кривой (огивы). Для дискретных данных строится ступенчатая линия, где на оси абсцисс откладываются значения признака, а на оси ординат — накопленные частоты. Для интервальных данных (когда данные сгруппированы в интервалы) огива строится по верхним границам интервалов, что позволяет плавно аппроксимировать функцию распределения.

Кумулятивная кривая обладает следующими свойствами:

  • она монотонно возрастает (не убывает);
  • начинается в точке, соответствующей минимальному значению признака (накопленная частота равна частоте первого значения);
  • заканчивается в точке с максимальным значением признака, где накопленная частота равна объёму выборки.

Применение в статистике

Накопленные частоты широко используются в различных областях статистического анализа.

Расчёт квантилей

Медиана, квартили, децили и перцентили определяются на основе накопленных частот. Например, медиана — это значение признака, для которого накопленная частота достигает или превышает половину объёма выборки. В приведённом выше примере медиана равна 3 (накопленная частота 10 при N=20). Первый квартиль (25-й перцентиль) соответствует значению, при котором накопленная частота впервые превышает 0,25N, третий квартиль (75-й перцентиль) — 0,75N.

Анализ распределения

Накопленные частоты позволяют оценить, какая доля наблюдений сосредоточена в определённом диапазоне значений. Например, с их помощью можно определить, что 80% семей имеют не более 6 детей (накопленная частота 17 из 20). Это используется в контроле качества, демографии, социологии и экономике.

Построение эмпирической функции распределения

Эмпирическая функция распределения \(F_n(x)\) — это оценка теоретической функции распределения, построенная по выборке. Для каждого значения \(x\) она равна доле наблюдений, не превышающих \(x\), то есть относительной накопленной частоте. Эта функция используется для проверки гипотез о распределении данных (например, критерий Колмогорова-Смирнова).

Сравнение выборок

Относительные накопленные частоты позволяют сравнивать распределения двух или более выборок разного объёма. Например, можно построить кумулятивные кривые для доходов в разных регионах и визуально оценить, в каком из них доходы в целом выше.

Связь с другими статистическими показателями

Накопленная частота тесно связана с понятием ранга. Ранг наблюдения — это его порядковый номер в упорядоченном ряду, который равен накопленной частоте для данного значения, если все значения различны. При наличии повторяющихся значений ранг может определяться как среднее арифметическое соответствующих порядковых номеров.

Также накопленные частоты используются при вычислении коэффициента Джини (показателя неравенства) для дискретных данных. В этом случае строится кривая Лоренца, которая представляет собой график зависимости накопленной доли общего дохода от накопленной доли населения, упорядоченного по возрастанию дохода. Накопленные частоты здесь выступают в роли долей населения.

Ограничения и особенности

Накопленные частоты чувствительны к порядку значений признака: они имеют смысл только для количественных или порядковых (ординальных) данных. Для номинативных (категориальных) данных, не имеющих естественного порядка, понятие накопленной частоты не применимо.

При интерпретации накопленных частот важно учитывать, что они отражают только информацию о положении значений относительно друг друга, но не о разбросе данных внутри интервалов. Для интервальных данных предполагается равномерное распределение значений внутри каждого интервала, что может вносить погрешность при расчёте квантилей.

Историческая справка

Понятие накопленной частоты восходит к работам английского статистика Фрэнсиса Гальтона (1822–1911), который ввёл понятие огивы для визуализации кумулятивных распределений. Гальтон использовал этот инструмент для анализа наследственных признаков и антропометрических данных. Позднее, в XX веке, накопленные частоты стали стандартным элементом описательной статистики, вошли в учебники и программное обеспечение для статистического анализа (например, SPSS, R, Python).

Примеры использования в различных областях

  • Демография: накопленные частоты возрастов населения позволяют определить долю людей младше определённого возраста, что используется для построения возрастных пирамид и расчёта коэффициентов демографической нагрузки.
  • Экономика: анализ распределения доходов с помощью накопленных частот позволяет выявить долю населения с доходами ниже прожиточного минимума или выше определённого порога.
  • Медицина: в клинических исследованиях накопленные частоты используются для оценки выживаемости (кривые Каплана-Мейера), где они показывают долю пациентов, проживших определённое время.
  • Контроль качества: накопленные частоты дефектов в партии продукции помогают построить диаграмму Парето, где они отображают кумулятивный вклад каждого типа дефекта в общее количество.

Источники

  1. Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшая школа, 2003.
  2. Кендалл М., Стьюарт А. Теория распределений. — М.: Наука, 1966.
  3. Орлов А. И. Прикладная статистика. — М.: Экзамен, 2004.
  4. Гальтон Ф. Наследственный гений. — Лондон: Macmillan, 1869.
  5. Вентцель Е. С. Теория вероятностей. — М.: Высшая школа, 1999.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →