Открыть сервис

Таблица сопряжённости

Таблица сопряжённости — это способ представления многомерных данных в виде матрицы, строки которой соответствуют значениям одной категориальной переменной, а столбцы — значениям другой. Каждая ячейка таблицы содержит частоту (количество наблюдений) или долю (относительную частоту) для комбинации соответствующих значений двух переменных. Таблицы сопряжённости являются основным инструментом анализа взаимосвязей между номинальными или порядковыми (категориальными) переменными в статистике, социологии, медицине, маркетинге и других областях, где требуется выявить зависимость между признаками.

История

Идея представления данных в виде перекрёстной таблицы восходит к работам английского статистика Карла Пирсона (1857–1936), который в начале XX века разработал критерий хи-квадрат (χ²) для проверки гипотез о независимости переменных на основе частотных таблиц. Пирсон ввёл понятие «таблицы непредвиденных обстоятельств» (contingency table), что дословно переводится как «таблица сопряжённости». В 1904 году он опубликовал статью, где впервые систематически описал метод анализа таких таблиц. Впоследствии, в 1930-х годах, британский статистик Рональд Фишер развил теорию точного критерия Фишера для малых выборок, что стало важным дополнением к методам анализа таблиц сопряжённости.

В XX веке с развитием вычислительной техники и появлением статистических пакетов (SPSS, SAS, R, Python) таблицы сопряжённости стали стандартным инструментом анализа данных. В современной науке они используются для проверки гипотез о независимости признаков, расчёта мер связи (коэффициенты корреляции, ассоциации) и визуализации данных в виде мозаичных или столбчатых диаграмм.

Структура и виды

Основные элементы

Таблица сопряжённости имеет размерность r × c, где r — количество строк (категорий первой переменной), c — количество столбцов (категорий второй переменной). Каждая ячейка nᵢⱼ содержит частоту наблюдений, попавших в i-ю строку и j-й столбец. Дополнительно вычисляются:

  • Маргинальные частоты: суммы по строкам (nᵢ·) и по столбцам (n·ⱼ), показывающие распределение каждой переменной по отдельности.
  • Общая сумма (N) — количество всех наблюдений.

Пример таблицы 2×2 (две переменные с двумя категориями):

КуритНе куритИтого
Мужчины302050
Женщины104050
Итого4060100

Виды таблиц

  1. По размерности:
  • 2×2 (четырёхпольная таблица) — простейший случай, часто используется для анализа связи между двумя дихотомическими переменными (например, «пол» и «курение»).
  • r × c (обобщённая таблица) — для переменных с произвольным числом категорий.
  1. По типу частот:
  • Абсолютные частоты — количество наблюдений.
  • Относительные частоты (проценты) — доля от общего числа наблюдений, от маргинальной суммы строки или столбца (например, процент курящих среди мужчин).
  1. По способу заполнения:
  • Эмпирические — получены из реальных наблюдений.
  • Теоретические (ожидаемые) — вычисляются при условии независимости переменных (используются для проверки гипотез).

Применение

Проверка гипотез

Основное применение таблиц сопряжённости — проверка статистической гипотезы о независимости двух категориальных переменных. Для этого используются:

  • Критерий χ² (хи-квадрат) Пирсона — сравнивает наблюдаемые частоты с ожидаемыми при условии независимости. Если различие значимо (p-значение < 0,05), нулевая гипотеза отвергается.
  • Точный критерий Фишера — применяется для малых выборок (когда ожидаемые частоты в ячейках меньше 5).
  • Критерий Мак-Немара — для парных наблюдений (например, до и после лечения).

Меры связи

Для оценки силы связи между переменными используются коэффициенты:

  • Коэффициент φ (фи) — для таблиц 2×2 (от -1 до 1).
  • Коэффициент Крамера V — для таблиц произвольной размерности (от 0 до 1).
  • Коэффициент контингенции Пирсона (C) — аналог корреляции для категориальных данных.
  • Отношение шансов (odds ratio) — для таблиц 2×2, показывает, во сколько раз шанс события в одной группе больше, чем в другой.

Визуализация

Таблицы сопряжённости визуализируются с помощью:

  • Мозаичных диаграмм (mosaic plot) — прямоугольники, размер которых пропорционален частоте.
  • Столбчатых диаграмм (stacked bar chart) — для сравнения распределений по строкам или столбцам.
  • Тепловых карт (heatmap) — цветом кодируется частота или доля.

Примеры

Медицина

Исследование связи между приёмом лекарства и выздоровлением:

ВыздоровелНе выздоровелИтого
Принимал8020100
Не принимал3070100
Итого11090200

Анализ показывает, что шанс выздороветь при приёме лекарства в 9,3 раза выше (отношение шансов = (80/20) / (30/70) ≈ 9,33).

Социология

Опрос о предпочтениях по полу:

КофеЧайИтого
Мужчины4060100
Женщины7030100
Итого11090200

Критерий χ² показывает значимую связь (χ² ≈ 18,18, p < 0,001), что указывает на зависимость предпочтений от пола.

Ограничения и критика

  • Проблема малых частот: при ожидаемых частотах менее 5 в ячейках критерий χ² может давать неточные результаты; требуется точный критерий Фишера.
  • Потеря информации: таблицы сопряжённости не учитывают порядковые или количественные признаки, если они не сгруппированы в категории.
  • Множественные сравнения: при анализе большого числа таблиц возрастает риск ошибки первого рода (ложно-положительных результатов).
  • Непричинная связь: статистическая зависимость не означает причинно-следственной связи; возможны смешивающие факторы.

Интересные факты

  • В 1912 году британский статистик Уильям Сили Госсет (псевдоним «Стьюдент») использовал таблицы сопряжённости для анализа данных о пивоварении, что привело к разработке t-критерия.
  • Таблицы сопряжённости являются частным случаем многомерных таблиц (контингентных таблиц), которые могут включать три и более переменных — так называемые многомерные таблицы сопряжённости (например, 2×2×2).
  • В машинном обучении таблицы сопряжённости используются для оценки качества классификаторов: матрица ошибок (confusion matrix) — это таблица 2×2, где строки — истинные классы, столбцы — предсказанные.

Источники

  1. Пирсон К. «О критерии того, что данная система отклонений от вероятного в случае коррелированной системы переменных такова, что её можно разумно считать возникшей случайной выборкой» (1900).
  2. Фишер Р. А. «Статистические методы для исследователей» (1925).
  3. Агарева М. В., Болдин М. В. «Статистический анализ таблиц сопряжённости» // Прикладная эконометрика, 2010.
  4. Everitt B. S. «The Analysis of Contingency Tables» (2nd ed., 1992).
  5. Agresti A. «Categorical Data Analysis» (3rd ed., 2013).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →