Открыть сервис

Описательная статистика

Описательная статистика — это раздел статистики, занимающийся сбором, систематизацией, обработкой и представлением данных в наглядной форме, а также расчётом показателей, описывающих основные свойства наблюдаемой совокупности. В отличие от индуктивной статистики, которая делает выводы о генеральной совокупности на основе выборки, описательная статистика ограничивается характеристиками имеющегося набора данных без экстраполяции на более широкую область. Основная цель описательной статистики — сжато и информативно описать массив данных, выявить его структуру, центральные тенденции и разброс.

История

Истоки описательной статистики восходят к XVII—XVIII векам, когда в Европе начали систематически собирать демографические и экономические данные. Английский учёный Джон Граунт (1620—1674) в своей работе «Естественные и политические наблюдения, сделанные над бюллетенями смертности» (1662) впервые применил методы систематизации и анализа массовых данных о рождениях и смертностях в Лондоне. В XIX веке бельгийский астроном и статистик Адольф Кетле (1796—1874) развил концепцию «среднего человека» и ввёл в обиход многие инструменты описательной статистики, включая средние величины и меры вариации. Значительный вклад внёс английский статистик Фрэнсис Гальтон (1822—1911), разработавший методы корреляционного анализа и регрессии, а также понятие процентилей. В XX веке с развитием вычислительной техники описательная статистика стала неотъемлемой частью анализа данных в науке, бизнесе и государственном управлении.

Основные задачи и методы

Описательная статистика решает несколько ключевых задач: представление данных в удобной для восприятия форме, выявление их центральных свойств, оценка разброса значений и определение формы распределения. Для этого используются три группы методов: графические, табличные и числовые.

Графические методы

Графические методы позволяют визуализировать распределение данных и выявить закономерности. Основные виды графиков:

  • Гистограмма — столбчатая диаграмма, показывающая частоту попадания значений в заданные интервалы (бины). Используется для непрерывных данных.
  • Полигон частот — ломаная линия, соединяющая точки, соответствующие частотам или относительным частотам в середине каждого интервала. Является альтернативой гистограмме.
  • Ящик с усами (boxplot) — график, отображающий медиану, квартили и выбросы. Позволяет быстро оценить симметричность распределения и наличие аномалий.
  • Круговая диаграмма — используется для отображения долей категориальных переменных.
  • Столбчатая диаграмма — применяется для сравнения значений категориальных или дискретных переменных.
  • Точечная диаграмма (scatterplot) — показывает взаимосвязь между двумя количественными переменными.

Табличные методы

Таблицы частот и сопряжённости систематизируют данные. Таблица частот содержит перечень уникальных значений (или интервалов) и соответствующие им частоты (абсолютные или относительные). Таблица сопряжённости (кросс-табуляция) используется для анализа взаимосвязи двух или более категориальных переменных.

Числовые характеристики

Числовые характеристики делятся на три основные категории: меры центральной тенденции, меры разброса (вариации) и меры формы распределения.

Меры центральной тенденции

Эти показатели описывают «центр» распределения данных, то есть типичное значение.

  • Среднее арифметическое — сумма всех значений, делённая на их количество. Чувствительно к выбросам.
  • Медиана — значение, которое делит упорядоченный набор данных пополам: половина значений меньше медианы, половина — больше. Устойчива к выбросам.
  • Мода — наиболее часто встречающееся значение в наборе данных. Может быть несколько мод (мультимодальное распределение) или ни одной (если все значения встречаются одинаково часто).

Меры разброса (вариации)

Эти показатели характеризуют степень рассеяния данных относительно центра.

  • Размах — разность между максимальным и минимальным значениями.
  • Дисперсия — среднее арифметическое квадратов отклонений каждого значения от среднего. Показывает, насколько в среднем значения отклоняются от среднего.
  • Стандартное отклонение — квадратный корень из дисперсии. Имеет ту же размерность, что и исходные данные, что облегчает интерпретацию.
  • Межквартильный размах — разность между третьим и первым квартилями (Q3 — Q1). Устойчив к выбросам.
  • Коэффициент вариации — отношение стандартного отклонения к среднему арифметическому, выраженное в процентах. Позволяет сравнивать вариабельность данных с разными единицами измерения.

Меры формы распределения

Эти показатели описывают асимметрию и крутость распределения.

  • Асимметрия (skewness) — мера симметричности распределения. Положительная асимметрия означает, что «хвост» распределения длиннее справа, отрицательная — слева.
  • Эксцесс (kurtosis) — мера «остроты» пика распределения относительно нормального распределения. Высокий эксцесс указывает на более острый пик и толстые хвосты, низкий — на более плоскую вершину.

Классификация данных

Для корректного применения методов описательной статистики важно понимать тип данных. Различают:

  • Количественные (числовые) данные:
  • Дискретные — принимают только целые значения (например, количество детей в семье).
  • Непрерывные — могут принимать любые значения в некотором интервале (например, рост, вес, температура).
  • Качественные (категориальные) данные:
  • Номинальные — не имеют естественного порядка (например, цвет глаз, страна проживания).
  • Порядковые — имеют естественный порядок, но интервалы между значениями не равны (например, уровень образования, оценка по шкале от 1 до 5).

Применение

Описательная статистика широко используется в различных областях:

  • Научные исследования — для первичного анализа экспериментальных данных, выявления выбросов и описания выборки.
  • Экономика и финансы — для анализа доходов, расходов, цен акций, инфляции.
  • Медицина — для описания демографических характеристик пациентов, распределения симптомов, эффективности лечения.
  • Социология и маркетинг — для обработки результатов опросов, изучения потребительских предпочтений.
  • Государственная статистика — для составления отчётов о населении, занятости, ВВП и других макроэкономических показателях.

Ограничения

Описательная статистика не позволяет делать выводы о причинно-следственных связях или распространять результаты на более широкую совокупность. Она лишь описывает имеющиеся данные, но не даёт вероятностных оценок. Для проверки гипотез и обобщения результатов необходимы методы индуктивной статистики (например, доверительные интервалы, критерии значимости). Кроме того, на интерпретацию числовых характеристик могут сильно влиять выбросы и объём выборки.

Интересные факты

  • Термин «статистика» происходит от латинского слова «status» (состояние) и первоначально означал сбор данных о государстве.
  • Среднее арифметическое является наиболее распространённой мерой центральной тенденции, но в случае сильно асимметричных распределений (например, доходов) медиана даёт более адекватную оценку «типичного» значения.
  • В 1880-х годах Фрэнсис Гальтон ввёл понятие «квартили» и «процентили», которые до сих пор широко используются в образовании и медицине (например, центильные таблицы роста детей).

Источники

  1. Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшая школа, 2003.
  2. Кендалл М., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973.
  3. Орлов А. И. Прикладная статистика. — М.: Экзамен, 2006.
  4. Freedman D., Pisani R., Purves R. Statistics. — 4th ed. — W. W. Norton & Company, 2007.
  5. Moore D. S., McCabe G. P., Craig B. A. Introduction to the Practice of Statistics. — 9th ed. — W. H. Freeman, 2017.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →