Открыть сервис

Расстояние Кука

Расстояние Кука (англ. Cook’s distance) — это мера влияния отдельного наблюдения (точки данных) на результаты регрессионного анализа, в первую очередь на оценки коэффициентов модели, полученные методом наименьших квадратов. Используется для выявления выбросов и влиятельных наблюдений, которые могут существенно искажать предсказательную способность или статистические выводы модели. Расстояние Кука объединяет в себе информацию о том, насколько сильно удаление конкретного наблюдения изменяет все коэффициенты регрессии, и о том, насколько это наблюдение является «рычагом» (левериджем) — то есть, насколько его значение предиктора отклоняется от среднего.

История и происхождение

Метрика была предложена американским статистиком Р. Деннисом Куком (R. Dennis Cook) в 1977 году в статье «Detection of Influential Observation in Linear Regression» (опубликована в журнале Technometrics). Кук работал в Университете Миннесоты и занимался проблемами робастной статистики и диагностики регрессионных моделей. Его работа стала частью более широкого направления в статистике 1970-х годов, связанного с выявлением влиятельных наблюдений, которое развивали также Ф. Мостеллер, Дж. Тьюки и Д. Белсли. До появления расстояния Кука для оценки влиятельности использовались в основном графические методы (например, графики остатков) и простые меры, такие как «рычаг» (hat values). Расстояние Кука предложило количественную, единую меру, которая легко вычисляется и интерпретируется.

Формальное определение

Пусть имеется линейная регрессионная модель:

\[ y = X\beta + \varepsilon \]

где \(y\) — вектор зависимой переменной размерности \(n \times 1\), \(X\) — матрица предикторов размерности \(n \times p\) (включая столбец единиц для свободного члена), \(\beta\) — вектор коэффициентов размерности \(p \times 1\), \(\varepsilon\) — вектор ошибок.

Оценка коэффициентов по методу наименьших квадратов (МНК) для полной выборки: \(\hat{\beta} = (X^T X)^{-1} X^T y\).

Пусть \(\hat{\beta}_{(i)}\) — оценка коэффициентов, полученная по выборке, из которой удалено \(i\)-е наблюдение.

Тогда расстояние Кука для \(i\)-го наблюдения определяется как:

\[ D_i = \frac{(\hat{\beta} - \hat{\beta}_{(i)})^T (X^T X) (\hat{\beta} - \hat{\beta}_{(i)})}{p \cdot \text{MSE}} \]

где:

  • \(p\) — количество коэффициентов модели (включая свободный член);
  • \(\text{MSE}\) — среднеквадратичная ошибка модели (оценка дисперсии ошибок \(\sigma^2\)), вычисленная по полной выборке: \(\text{MSE} = \frac{1}{n-p} \sum_{j=1}^n (y_j - \hat{y}_j)^2\).

На практике чаще используется эквивалентная формула, выражающая \(D_i\) через стандартизированные остатки \(e_i\) и «рычаг» \(h_{ii}\):

\[ D_i = \frac{e_i^2}{p \cdot \text{MSE}} \cdot \frac{h_{ii}}{(1 - h_{ii})^2} \]

где:

  • \(e_i = y_i - \hat{y}_i\) — остаток для \(i\)-го наблюдения;
  • \(h_{ii}\) — диагональный элемент матрицы проекции \(H = X(X^T X)^{-1} X^T\) (hat matrix), который измеряет «рычаг» (леверидж) наблюдения.

Интерпретация

Расстояние Кука показывает, насколько изменится вектор всех коэффициентов регрессии, если исключить данное наблюдение. Значение \(D_i\) может быть от 0 до бесконечности. Чем больше \(D_i\), тем большее влияние наблюдение оказывает на модель.

Пороговые значения (эвристические правила):

  • Если \(D_i > 1\), наблюдение считается сильно влиятельным и заслуживает пристального изучения.
  • Если \(D_i > 4/n\) (где \(n\) — объём выборки), наблюдение может быть признано потенциально влиятельным.
  • В некоторых руководствах рекомендуется рассматривать наблюдения с \(D_i > 0.5\) как подозрительные.

Эти пороги не являются строгими статистическими критериями, а служат ориентирами. Влиятельность наблюдения должна оцениваться в контексте конкретной задачи, с учётом содержательного смысла данных.

Связь с другими диагностическими мерами

Расстояние Кука объединяет две компоненты:

  1. Рычаг (леверидж) \(h_{ii}\) — измеряет, насколько значение предиктора для данного наблюдения удалено от среднего. Наблюдения с большим рычагом имеют необычные значения предикторов и могут сильно влиять на наклон регрессии.
  2. Стандартизированный остаток \(e_i / \sqrt{\text{MSE}}\) — измеряет, насколько сильно наблюдение отклоняется от предсказанного значения модели.

Наблюдение может иметь большое расстояние Кука в трёх случаях:

  • Большой остаток (выброс по \(y\)) при умеренном рычаге;
  • Большой рычаг (выброс по \(x\)) при умеренном остатке;
  • Комбинация умеренных значений обеих компонент.

Другие меры влиятельности:

  • DFBETAS — изменение каждого коэффициента по отдельности при удалении наблюдения.
  • DFFITS — изменение предсказанного значения для данного наблюдения.
  • COVRATIO — изменение ковариационной матрицы оценок.

Расстояние Кука является более общей мерой, так как оценивает суммарное изменение всех коэффициентов.

Применение

В статистическом моделировании

  • Выявление выбросов и влиятельных точек в регрессионном анализе, дисперсионном анализе (ANOVA), обобщённых линейных моделях.
  • Диагностика модели после подгонки — обязательный этап проверки адекватности регрессии. Если обнаружены наблюдения с большим \(D_i\), их необходимо исследовать: возможно, это ошибки ввода данных, редкие события или наблюдения, требующие отдельной модели.
  • Робастная регрессия — расстояние Кука используется для взвешивания наблюдений или для автоматического удаления влиятельных точек.

В машинном обучении

  • Анализ влиятельности в линейных моделях (например, в линейной регрессии, гребневой регрессии, LASSO). В нелинейных моделях (деревья решений, нейронные сети) расстояние Кука применяется реже, но существуют его обобщения.
  • Обнаружение аномалий — в некоторых задачах (например, в финансах, медицине) точки с высоким \(D_i\) могут указывать на мошеннические операции, редкие заболевания или ошибки измерений.
  • Оценка устойчивости модели — если удаление одного наблюдения сильно меняет модель, это свидетельствует о её нестабильности.

В конкретных областях

  • Эконометрика — анализ влиятельных наблюдений в регрессиях по временным рядам, панельным данным.
  • Биостатистика — в клинических исследованиях для выявления пациентов с аномальным ответом на лечение.
  • Социология и психология — при обработке опросных данных для выявления респондентов, дающих нетипичные ответы.

Пример расчёта (упрощённый)

Рассмотрим простую линейную регрессию \(y = a + bx\) с тремя наблюдениями:

  • (1, 2), (2, 3), (10, 10)

По полной выборке: \(\hat{y} = 1.0 + 0.9x\), MSE = 0.33.

Для наблюдения (10, 10):

  • Остаток \(e = 10 - (1.0 + 0.9 \cdot 10) = 10 - 10 = 0\);
  • Рычаг \(h_{ii}\) для этого наблюдения высок (так как \(x=10\) далеко от среднего \(\bar{x} \approx 4.33\));
  • \(D_i \approx 0.6\) — умеренное влияние.

Если бы остаток был ненулевым (например, \(y=12\)), \(D_i\) могло бы превысить 1.

Ограничения и критика

  • Чувствительность к мультиколлинеарности — при сильной корреляции предикторов расстояние Кука может давать искажённые результаты.
  • Неприменимость к нелинейным моделям — в чистом виде формула выведена для линейной регрессии. Для обобщённых линейных моделей, деревьев решений, нейронных сетей существуют аналоги, но они менее стандартизированы.
  • Эвристичность порогов — нет строгого статистического обоснования для пороговых значений \(D_i > 1\) или \(D_i > 4/n\). Они основаны на практическом опыте.
  • Зависимость от объёма выборки — при малых \(n\) даже одно влиятельное наблюдение может сильно исказить модель, а при больших \(n\) влияние отдельных точек обычно снижается.
  • Не различает причину влиятельности — расстояние Кука не показывает, является ли наблюдение выбросом по \(y\) или по \(x\), требуется дополнительный анализ.

Реализация в программном обеспечении

Расстояние Кука реализовано во всех основных статистических пакетах и языках программирования:

  • R — функция cooks.distance() в пакете stats (для объектов класса lm).
  • Python — метод cooks_distance() в библиотеке statsmodels (для результатов регрессии) или ручное вычисление с помощью scikit-learn и numpy.
  • SPSS — опция «Casewise diagnostics» в модуле регрессионного анализа.
  • Stataкоманда predict, cooksd.
  • MATLAB — функция regress возвращает вектор расстояний Кука в качестве одного из выходных аргументов.

В большинстве пакетов расстояние Кука автоматически вычисляется при построении регрессионной модели и доступно для визуализации (например, на графике «Residuals vs Leverage»).

Интересные факты

  • Р. Деннис Кук впоследствии разработал также расстояние Кука для обобщённых линейных моделей (GLM) и для моделей с гетероскедастичностью.
  • В некоторых учебниках расстояние Кука называют «мерой Кука» или «статистикой Кука».
  • В 1980-х годах расстояние Кука вошло в стандартный набор диагностических процедур для регрессионного анализа, наряду с Q-Q-графиками и тестом Дарбина-Уотсона.
  • В эпоху больших данных (Big Data) расстояние Кука потеряло часть своей актуальности для сверхбольших выборок (миллионы наблюдений), где влияние отдельной точки ничтожно, но остаётся важным инструментом в малых и средних выборках, а также в задачах, где каждое наблюдение имеет высокую стоимость (например, клинические испытания).

Источники

  • Cook, R. D. (1977). «Detection of Influential Observation in Linear Regression». Technometrics, 19(1), 15–18.
  • Belsley, D. A., Kuh, E., & Welsch, R. E. (1980). «Regression Diagnostics: Identifying Influential Data and Sources of Collinearity». Wiley.
  • Fox, J. (1991). «Regression Diagnostics: An Introduction». Sage Publications.
  • Chatterjee, S., & Hadi, A. S. (1986). «Influential Observations, High Leverage Points, and Outliers in Linear Regression». Statistical Science, 1(3), 379–393.
  • Montgomery, D. C., Peck, E. A., & Vining, G. G. (2012). «Introduction to Linear Regression Analysis» (5th ed.). Wiley.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →