Описательная статистика¶
Описательная статистика — это раздел статистики, занимающийся сбором, систематизацией, обработкой и представлением данных в наглядной форме, а также расчётом показателей, описывающих основные свойства наблюдаемой совокупности. В отличие от индуктивной статистики, которая делает выводы о генеральной совокупности на основе выборки, описательная статистика ограничивается характеристиками имеющегося набора данных без экстраполяции на более широкую область. Основная цель описательной статистики — сжато и информативно описать массив данных, выявить его структуру, центральные тенденции и разброс.
¶История
Истоки описательной статистики восходят к XVII—XVIII векам, когда в Европе начали систематически собирать демографические и экономические данные. Английский учёный Джон Граунт (1620—1674) в своей работе «Естественные и политические наблюдения, сделанные над бюллетенями смертности» (1662) впервые применил методы систематизации и анализа массовых данных о рождениях и смертностях в Лондоне. В XIX веке бельгийский астроном и статистик Адольф Кетле (1796—1874) развил концепцию «среднего человека» и ввёл в обиход многие инструменты описательной статистики, включая средние величины и меры вариации. Значительный вклад внёс английский статистик Фрэнсис Гальтон (1822—1911), разработавший методы корреляционного анализа и регрессии, а также понятие процентилей. В XX веке с развитием вычислительной техники описательная статистика стала неотъемлемой частью анализа данных в науке, бизнесе и государственном управлении.
¶Основные задачи и методы
Описательная статистика решает несколько ключевых задач: представление данных в удобной для восприятия форме, выявление их центральных свойств, оценка разброса значений и определение формы распределения. Для этого используются три группы методов: графические, табличные и числовые.
¶Графические методы
Графические методы позволяют визуализировать распределение данных и выявить закономерности. Основные виды графиков:
- Гистограмма — столбчатая диаграмма, показывающая частоту попадания значений в заданные интервалы (бины). Используется для непрерывных данных.
- Полигон частот — ломаная линия, соединяющая точки, соответствующие частотам или относительным частотам в середине каждого интервала. Является альтернативой гистограмме.
- Ящик с усами (boxplot) — график, отображающий медиану, квартили и выбросы. Позволяет быстро оценить симметричность распределения и наличие аномалий.
- Круговая диаграмма — используется для отображения долей категориальных переменных.
- Столбчатая диаграмма — применяется для сравнения значений категориальных или дискретных переменных.
- Точечная диаграмма (scatterplot) — показывает взаимосвязь между двумя количественными переменными.
¶Табличные методы
Таблицы частот и сопряжённости систематизируют данные. Таблица частот содержит перечень уникальных значений (или интервалов) и соответствующие им частоты (абсолютные или относительные). Таблица сопряжённости (кросс-табуляция) используется для анализа взаимосвязи двух или более категориальных переменных.
¶Числовые характеристики
Числовые характеристики делятся на три основные категории: меры центральной тенденции, меры разброса (вариации) и меры формы распределения.
¶Меры центральной тенденции
Эти показатели описывают «центр» распределения данных, то есть типичное значение.
- Среднее арифметическое — сумма всех значений, делённая на их количество. Чувствительно к выбросам.
- Медиана — значение, которое делит упорядоченный набор данных пополам: половина значений меньше медианы, половина — больше. Устойчива к выбросам.
- Мода — наиболее часто встречающееся значение в наборе данных. Может быть несколько мод (мультимодальное распределение) или ни одной (если все значения встречаются одинаково часто).
¶Меры разброса (вариации)
Эти показатели характеризуют степень рассеяния данных относительно центра.
- Размах — разность между максимальным и минимальным значениями.
- Дисперсия — среднее арифметическое квадратов отклонений каждого значения от среднего. Показывает, насколько в среднем значения отклоняются от среднего.
- Стандартное отклонение — квадратный корень из дисперсии. Имеет ту же размерность, что и исходные данные, что облегчает интерпретацию.
- Межквартильный размах — разность между третьим и первым квартилями (Q3 — Q1). Устойчив к выбросам.
- Коэффициент вариации — отношение стандартного отклонения к среднему арифметическому, выраженное в процентах. Позволяет сравнивать вариабельность данных с разными единицами измерения.
¶Меры формы распределения
Эти показатели описывают асимметрию и крутость распределения.
- Асимметрия (skewness) — мера симметричности распределения. Положительная асимметрия означает, что «хвост» распределения длиннее справа, отрицательная — слева.
- Эксцесс (kurtosis) — мера «остроты» пика распределения относительно нормального распределения. Высокий эксцесс указывает на более острый пик и толстые хвосты, низкий — на более плоскую вершину.
¶Классификация данных
Для корректного применения методов описательной статистики важно понимать тип данных. Различают:
- Количественные (числовые) данные:
- Дискретные — принимают только целые значения (например, количество детей в семье).
- Непрерывные — могут принимать любые значения в некотором интервале (например, рост, вес, температура).
- Качественные (категориальные) данные:
- Номинальные — не имеют естественного порядка (например, цвет глаз, страна проживания).
- Порядковые — имеют естественный порядок, но интервалы между значениями не равны (например, уровень образования, оценка по шкале от 1 до 5).
¶Применение
Описательная статистика широко используется в различных областях:
- Научные исследования — для первичного анализа экспериментальных данных, выявления выбросов и описания выборки.
- Экономика и финансы — для анализа доходов, расходов, цен акций, инфляции.
- Медицина — для описания демографических характеристик пациентов, распределения симптомов, эффективности лечения.
- Социология и маркетинг — для обработки результатов опросов, изучения потребительских предпочтений.
- Государственная статистика — для составления отчётов о населении, занятости, ВВП и других макроэкономических показателях.
¶Ограничения
Описательная статистика не позволяет делать выводы о причинно-следственных связях или распространять результаты на более широкую совокупность. Она лишь описывает имеющиеся данные, но не даёт вероятностных оценок. Для проверки гипотез и обобщения результатов необходимы методы индуктивной статистики (например, доверительные интервалы, критерии значимости). Кроме того, на интерпретацию числовых характеристик могут сильно влиять выбросы и объём выборки.
¶Интересные факты
- Термин «статистика» происходит от латинского слова «status» (состояние) и первоначально означал сбор данных о государстве.
- Среднее арифметическое является наиболее распространённой мерой центральной тенденции, но в случае сильно асимметричных распределений (например, доходов) медиана даёт более адекватную оценку «типичного» значения.
- В 1880-х годах Фрэнсис Гальтон ввёл понятие «квартили» и «процентили», которые до сих пор широко используются в образовании и медицине (например, центильные таблицы роста детей).
¶Источники
- Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшая школа, 2003.
- Кендалл М., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973.
- Орлов А. И. Прикладная статистика. — М.: Экзамен, 2006.
- Freedman D., Pisani R., Purves R. Statistics. — 4th ed. — W. W. Norton & Company, 2007.
- Moore D. S., McCabe G. P., Craig B. A. Introduction to the Practice of Statistics. — 9th ed. — W. H. Freeman, 2017.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


