Диаграмма рассеяния в статистике¶
Диаграмма рассеяния (также scatter plot, точечная диаграмма, график рассеяния) — это тип математической диаграммы, используемой для отображения значений двух переменных для набора данных. Каждая точка на графике соответствует одному наблюдению и имеет координаты, определяемые значениями этих двух переменных по осям X и Y. Диаграмма рассеяния является одним из основных инструментов визуализации в статистике, анализе данных и научных исследованиях, позволяя наглядно оценить наличие, характер и силу взаимосвязи между переменными.
¶История и происхождение
Метод визуализации данных с помощью точек на координатной плоскости имеет давнюю историю, восходящую к работам по аналитической геометрии. Однако в современном виде диаграмма рассеяния стала использоваться в статистике лишь в XIX веке. Одним из пионеров применения точечных графиков для анализа корреляции считается английский учёный Фрэнсис Гальтон, который в 1870–1880-х годах изучал наследственность и связь между ростом родителей и детей. Его работы заложили основы регрессионного анализа, неотъемлемо связанного с диаграммами рассеяния.
Позднее, в начале XX века, английский статистик Карл Пирсон формализовал понятие корреляции, а диаграмма рассеяния стала стандартным инструментом для визуальной проверки линейной зависимости перед вычислением коэффициента корреляции. С развитием вычислительной техники во второй половине XX века scatter plot стал одним из базовых типов графиков в статистических пакетах (SPSS, SAS, R, MATLAB) и электронных таблицах.
¶Назначение и применение
Основная цель диаграммы рассеяния — выявление взаимосвязи (корреляции) между двумя количественными переменными. По виду облака точек можно сделать предварительные выводы о характере зависимости:
- Положительная корреляция: точки образуют облако, вытянутое слева снизу вправо вверх (с ростом X растёт Y).
- Отрицательная корреляция: облако вытянуто слева сверху вправо вниз (с ростом X убывает Y).
- Отсутствие корреляции: точки распределены хаотично, без выраженной закономерности.
- Нелинейная зависимость: точки группируются вдоль кривой (например, параболы или экспоненты), что указывает на необходимость применения нелинейных моделей.
Диаграмма рассеяния позволяет также выявлять кластеры (группы точек, указывающие на наличие подгрупп в данных) и выбросы (аномальные наблюдения, значительно отклоняющиеся от основной массы). Это делает её незаменимым инструментом на этапе разведочного анализа данных (EDA).
¶Области использования
- Статистика и эконометрика: первичная оценка зависимости перед построением регрессионных моделей.
- Естественные науки: физика (законы, связывающие величины), биология (зависимость роста от условий среды).
- Медицина: анализ связи дозировки препарата и эффекта, показателей здоровья.
- Маркетинг и социология: изучение зависимости между рекламным бюджетом и продажами.
- Контроль качества: анализ связи параметров производственного процесса.
- Машинное обучение: визуализация признаков для оценки разделимости классов.
¶Разновидности и модификации
Базовый scatter plot может быть модифицирован для отображения дополнительных измерений данных:
- Цвет точек — используется для кодирования третьей (категориальной) переменной, что позволяет визуально разделить наблюдения на группы.
- Размер точек (bubble chart, пузырьковая диаграмма) — кодирует четвёртую количественную переменную.
- Форма маркеров — ещё один способ различения категорий.
- Прозрачность (альфа-канал) — применяется при большом количестве точек для борьбы с перекрытием (оверплоттингом).
- Диаграмма рассеяния с маргинальными гистограммами — по краям графика добавляются распределения каждой переменной.
- Матрица диаграмм рассеяния (scatter plot matrix) — таблица из scatter plot для всех пар переменных многомерного набора данных.
¶Построение и интерпретация
Для построения диаграммы рассеяния необходимо выбрать две переменные: независимую (обычно откладывается по оси X) и зависимую (ось Y). Масштабы осей должны быть выбраны так, чтобы облако точек занимало большую часть площади графика. В случае, если переменные имеют разные единицы измерения, часто используют нормировку или логарифмическую шкалу.
Интерпретация диаграммы должна учитывать плотность точек: в областях с большим количеством перекрывающихся точек зависимость видна хуже. Для больших наборов данных (сотни тысяч и более точек) применяют специальные методы визуализации плотности: двумерные гистограммы (hexbin), сглаживание (kernel density estimation).
Ключевой момент: диаграмма рассеяния показывает только наличие и форму связи, но не доказывает причинно-следственную зависимость. Корреляция между переменными может быть ложной (спурьёзной), вызванной влиянием третьей, неучтённой переменной.
¶Связь с регрессионным анализом
Диаграмма рассеяния тесно связана с регрессионным анализом. На график часто добавляют линию регрессии (линию наилучшего подбора), которая математически описывает зависимость среднего значения Y от X. Расстояние от точек до этой линии характеризует остатки модели. Если точки плотно группируются вокруг прямой линии, это указывает на высокую точность линейной регрессии; если разброс велик — модель слабо объясняет вариацию данных.
Коэффициент корреляции Пирсона (r) количественно измеряет силу линейной связи, но именно scatter plot позволяет убедиться, что связь действительно линейна, а не, например, криволинейна (в последнем случае r может быть близок к нулю, несмотря на явную закономерность).
¶Ограничения и типичные ошибки
- Диаграмма рассеяния эффективна только для количественных переменных. Для категориальных данных используются другие типы графиков (столбчатые, ящики с усами).
- При малом количестве наблюдений выводы о корреляции могут быть ненадёжными.
- Ошибкой является интерпретация корреляции как причинно-следственной связи.
- Необходимо проверять данные на наличие выбросов, которые могут сильно исказить визуальное впечатление и статистические выводы.
- При использовании цвета для кодирования категорий следует учитывать ограничения восприятия (например, дальтонизм).
¶Программная реализация
Современные инструменты для создания диаграмм рассеяния включают библиотеки языков программирования: Matplotlib и Seaborn (Python), ggplot2 (R), а также функционал Excel, Google Sheets, Tableau и специализированных статистических пакетов. В Python минимальный пример с использованием Matplotlib выглядит следующим образом: функции plt.scatter(x, y) передаются массивы координат точек, после чего вызывается plt.show() для отображения графика.
¶Источники
- Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшее образование, 2007.
- Тьюки Дж. Анализ результатов наблюдений. Разведочный анализ. — М.: Мир, 1981.
- Уилкинсон Л. Грамматика графиков. — СПб.: Питер, 2018.
- Cleveland W. S. The Elements of Graphing Data. — Hobart Press, 1994.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
