Открыть сервис

Диаграмма рассеяния в статистике

Диаграмма рассеяния (также scatter plot, точечная диаграмма, график рассеяния) — это тип математической диаграммы, используемой для отображения значений двух переменных для набора данных. Каждая точка на графике соответствует одному наблюдению и имеет координаты, определяемые значениями этих двух переменных по осям X и Y. Диаграмма рассеяния является одним из основных инструментов визуализации в статистике, анализе данных и научных исследованиях, позволяя наглядно оценить наличие, характер и силу взаимосвязи между переменными.

История и происхождение

Метод визуализации данных с помощью точек на координатной плоскости имеет давнюю историю, восходящую к работам по аналитической геометрии. Однако в современном виде диаграмма рассеяния стала использоваться в статистике лишь в XIX веке. Одним из пионеров применения точечных графиков для анализа корреляции считается английский учёный Фрэнсис Гальтон, который в 1870–1880-х годах изучал наследственность и связь между ростом родителей и детей. Его работы заложили основы регрессионного анализа, неотъемлемо связанного с диаграммами рассеяния.

Позднее, в начале XX века, английский статистик Карл Пирсон формализовал понятие корреляции, а диаграмма рассеяния стала стандартным инструментом для визуальной проверки линейной зависимости перед вычислением коэффициента корреляции. С развитием вычислительной техники во второй половине XX века scatter plot стал одним из базовых типов графиков в статистических пакетах (SPSS, SAS, R, MATLAB) и электронных таблицах.

Назначение и применение

Основная цель диаграммы рассеяния — выявление взаимосвязи (корреляции) между двумя количественными переменными. По виду облака точек можно сделать предварительные выводы о характере зависимости:

  • Положительная корреляция: точки образуют облако, вытянутое слева снизу вправо вверх (с ростом X растёт Y).
  • Отрицательная корреляция: облако вытянуто слева сверху вправо вниз (с ростом X убывает Y).
  • Отсутствие корреляции: точки распределены хаотично, без выраженной закономерности.
  • Нелинейная зависимость: точки группируются вдоль кривой (например, параболы или экспоненты), что указывает на необходимость применения нелинейных моделей.

Диаграмма рассеяния позволяет также выявлять кластеры (группы точек, указывающие на наличие подгрупп в данных) и выбросы (аномальные наблюдения, значительно отклоняющиеся от основной массы). Это делает её незаменимым инструментом на этапе разведочного анализа данных (EDA).

Области использования

  • Статистика и эконометрика: первичная оценка зависимости перед построением регрессионных моделей.
  • Естественные науки: физика (законы, связывающие величины), биология (зависимость роста от условий среды).
  • Медицина: анализ связи дозировки препарата и эффекта, показателей здоровья.
  • Маркетинг и социология: изучение зависимости между рекламным бюджетом и продажами.
  • Контроль качества: анализ связи параметров производственного процесса.
  • Машинное обучение: визуализация признаков для оценки разделимости классов.

Разновидности и модификации

Базовый scatter plot может быть модифицирован для отображения дополнительных измерений данных:

  1. Цвет точек — используется для кодирования третьей (категориальной) переменной, что позволяет визуально разделить наблюдения на группы.
  2. Размер точек (bubble chart, пузырьковая диаграмма) — кодирует четвёртую количественную переменную.
  3. Форма маркеров — ещё один способ различения категорий.
  4. Прозрачность (альфа-канал) — применяется при большом количестве точек для борьбы с перекрытием (оверплоттингом).
  5. Диаграмма рассеяния с маргинальными гистограммами — по краям графика добавляются распределения каждой переменной.
  6. Матрица диаграмм рассеяния (scatter plot matrix) — таблица из scatter plot для всех пар переменных многомерного набора данных.

Построение и интерпретация

Для построения диаграммы рассеяния необходимо выбрать две переменные: независимую (обычно откладывается по оси X) и зависимую (ось Y). Масштабы осей должны быть выбраны так, чтобы облако точек занимало большую часть площади графика. В случае, если переменные имеют разные единицы измерения, часто используют нормировку или логарифмическую шкалу.

Интерпретация диаграммы должна учитывать плотность точек: в областях с большим количеством перекрывающихся точек зависимость видна хуже. Для больших наборов данных (сотни тысяч и более точек) применяют специальные методы визуализации плотности: двумерные гистограммы (hexbin), сглаживание (kernel density estimation).

Ключевой момент: диаграмма рассеяния показывает только наличие и форму связи, но не доказывает причинно-следственную зависимость. Корреляция между переменными может быть ложной (спурьёзной), вызванной влиянием третьей, неучтённой переменной.

Связь с регрессионным анализом

Диаграмма рассеяния тесно связана с регрессионным анализом. На график часто добавляют линию регрессии (линию наилучшего подбора), которая математически описывает зависимость среднего значения Y от X. Расстояние от точек до этой линии характеризует остатки модели. Если точки плотно группируются вокруг прямой линии, это указывает на высокую точность линейной регрессии; если разброс велик — модель слабо объясняет вариацию данных.

Коэффициент корреляции Пирсона (r) количественно измеряет силу линейной связи, но именно scatter plot позволяет убедиться, что связь действительно линейна, а не, например, криволинейна (в последнем случае r может быть близок к нулю, несмотря на явную закономерность).

Ограничения и типичные ошибки

  • Диаграмма рассеяния эффективна только для количественных переменных. Для категориальных данных используются другие типы графиков (столбчатые, ящики с усами).
  • При малом количестве наблюдений выводы о корреляции могут быть ненадёжными.
  • Ошибкой является интерпретация корреляции как причинно-следственной связи.
  • Необходимо проверять данные на наличие выбросов, которые могут сильно исказить визуальное впечатление и статистические выводы.
  • При использовании цвета для кодирования категорий следует учитывать ограничения восприятия (например, дальтонизм).

Программная реализация

Современные инструменты для создания диаграмм рассеяния включают библиотеки языков программирования: Matplotlib и Seaborn (Python), ggplot2 (R), а также функционал Excel, Google Sheets, Tableau и специализированных статистических пакетов. В Python минимальный пример с использованием Matplotlib выглядит следующим образом: функции plt.scatter(x, y) передаются массивы координат точек, после чего вызывается plt.show() для отображения графика.

Источники

  1. Гмурман В. Е. Теория вероятностей и математическая статистика. — М.: Высшее образование, 2007.
  2. Тьюки Дж. Анализ результатов наблюдений. Разведочный анализ. — М.: Мир, 1981.
  3. Уилкинсон Л. Грамматика графиков. — СПб.: Питер, 2018.
  4. Cleveland W. S. The Elements of Graphing Data. — Hobart Press, 1994.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →