Открыть сервис

Парадокс Анскомба

Парадокс Анскомба — это статистический феномен, заключающийся в том, что наборы данных, имеющие практически идентичные описательные статистики (средние значения, дисперсии, корреляции и коэффициенты линейной регрессии), могут визуально (на графиках) кардинально различаться. Парадокс демонстрирует важность графического представления данных и ограниченность использования только числовых статистических показателей для анализа.

История

Парадокс был впервые описан британским статистиком Фрэнсисом Анскомбом в 1973 году в статье «Графики в статистическом анализе» (англ. Graphs in Statistical Analysis), опубликованной в журнале The American Statistician. Анскомб, работавший в то время в Имперском колледже Лондона, стремился проиллюстрировать критическое значение визуализации данных, которое часто игнорировалось в пользу численных методов. Он создал четыре набора данных, каждый из которых состоял из 11 пар значений (x, y), и показал, что, несмотря на внешнюю схожесть статистических характеристик, их графическое представление выявляет принципиально разные структуры.

Описание и примеры

В оригинальной статье Анскомб привёл четыре набора данных. Для каждого из них были рассчитаны следующие статистические показатели, которые оказались практически идентичными (с точностью до двух-трёх знаков после запятой):

Несмотря на эти совпадения, графики (точечные диаграммы) каждого набора данных демонстрируют совершенно разные паттерны:

  1. Первый набор: представляет собой классическую линейную зависимость с небольшим случайным разбросом точек вокруг линии регрессии. Это «идеальный» пример для применения линейной регрессии.
  2. Второй набор: точки расположены не вдоль прямой линии, а образуют явную нелинейную (квадратичную) зависимость. Линейная регрессия здесь неприменима, так как она не отражает истинной формы связи.
  3. Третий набор: демонстрирует линейную зависимость, но с одним ярко выраженным выбросом (точка, сильно отклоняющаяся от общей закономерности). Этот выброс существенно влияет на линию регрессии, смещая её вверх, и без него корреляция была бы значительно выше.
  4. Четвёртый набор: представляет собой ситуацию, когда все точки, кроме одной, сконцентрированы вдоль вертикальной линии (x = 8), а одна точка-выброс (x = 19, y = 12,5) создаёт иллюзию линейной зависимости. Без этой точки корреляция и регрессия были бы неопределёнными.

Значение для статистики и анализа данных

Парадокс Анскомба имеет фундаментальное значение для методологии статистического анализа. Он наглядно демонстрирует, что:

  • Числовые показатели неполны: Средние, дисперсии и корреляции, взятые по отдельности, не могут описать структуру данных. Они могут быть одинаковыми для принципиально разных распределений.
  • Визуализация обязательна: Построение точечной диаграммы (scatter plot) является первым и необходимым шагом перед применением любых статистических методов, особенно регрессионного анализа. Только график позволяет выявить выбросы, нелинейность, гетероскедастичность (неравномерность разброса) и другие аномалии.
  • Критика формального подхода: Парадокс служит предостережением против слепого использования статистических тестов и коэффициентов без понимания природы данных. Он подчёркивает, что статистика — это не только вычисления, но и интерпретация.

Квартет Анскомба

Описанный выше набор из четырёх наборов данных получил название «квартет Анскомба». Он стал классическим педагогическим примером в курсах статистики, анализа данных и машинного обучения. Квартет используется для обучения студентов важности разведочного анализа данных (EDA) и визуализации.

Развитие концепции

В 2017 году, в связи с развитием вычислительных методов, был создан «Датазавр Анскомба» (англ. Datasaurus Dozen). Автор, Альберто Кайро, разработал 12 наборов данных, каждый из которых имеет те же описательные статистики, что и оригинальный квартет, но при визуализации образует различные фигуры, включая форму динозавра (отсюда и название). Этот пример ещё более наглядно демонстрирует, как одни и те же числовые показатели могут скрывать совершенно разные визуальные образы. Датазавр Анскомба стал мощным инструментом для популяризации визуализации данных и критики чрезмерного доверия к статистическим сводкам.

Критика и ограничения

Хотя парадокс Анскомба широко признан и используется в образовании, он не является парадоксом в строгом логическом смысле (отсутствует противоречие). Это скорее демонстрация методологической ошибки. Критика сводится к тому, что в реальных задачах редко встречаются данные с настолько точно совпадающими статистиками, как в искусственно созданном квартете. Однако сам принцип — что числовые показатели могут быть обманчивы — остаётся актуальным для любого набора данных, особенно при наличии выбросов или нелинейных зависимостей.

Источники

  • Anscombe, F. J. (1973). Graphs in Statistical Analysis. The American Statistician, 27(1), 17–21.
  • Chatterjee, S., & Hadi, A. S. (2012). Regression Analysis by Example (5th ed.). Wiley.
  • Tufte, E. R. (2001). The Visual Display of Quantitative Information (2nd ed.). Graphics Press.
  • Wickham, H., & Grolemund, G. (2017). R for Data Science. O'Reilly Media.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →