Расстояние Кука¶
Расстояние Кука (англ. Cook’s distance) — это мера влияния отдельного наблюдения (точки данных) на результаты регрессионного анализа, в первую очередь на оценки коэффициентов модели, полученные методом наименьших квадратов. Используется для выявления выбросов и влиятельных наблюдений, которые могут существенно искажать предсказательную способность или статистические выводы модели. Расстояние Кука объединяет в себе информацию о том, насколько сильно удаление конкретного наблюдения изменяет все коэффициенты регрессии, и о том, насколько это наблюдение является «рычагом» (левериджем) — то есть, насколько его значение предиктора отклоняется от среднего.
¶История и происхождение
Метрика была предложена американским статистиком Р. Деннисом Куком (R. Dennis Cook) в 1977 году в статье «Detection of Influential Observation in Linear Regression» (опубликована в журнале Technometrics). Кук работал в Университете Миннесоты и занимался проблемами робастной статистики и диагностики регрессионных моделей. Его работа стала частью более широкого направления в статистике 1970-х годов, связанного с выявлением влиятельных наблюдений, которое развивали также Ф. Мостеллер, Дж. Тьюки и Д. Белсли. До появления расстояния Кука для оценки влиятельности использовались в основном графические методы (например, графики остатков) и простые меры, такие как «рычаг» (hat values). Расстояние Кука предложило количественную, единую меру, которая легко вычисляется и интерпретируется.
¶Формальное определение
Пусть имеется линейная регрессионная модель:
\[ y = X\beta + \varepsilon \]
где \(y\) — вектор зависимой переменной размерности \(n \times 1\), \(X\) — матрица предикторов размерности \(n \times p\) (включая столбец единиц для свободного члена), \(\beta\) — вектор коэффициентов размерности \(p \times 1\), \(\varepsilon\) — вектор ошибок.
Оценка коэффициентов по методу наименьших квадратов (МНК) для полной выборки: \(\hat{\beta} = (X^T X)^{-1} X^T y\).
Пусть \(\hat{\beta}_{(i)}\) — оценка коэффициентов, полученная по выборке, из которой удалено \(i\)-е наблюдение.
Тогда расстояние Кука для \(i\)-го наблюдения определяется как:
\[ D_i = \frac{(\hat{\beta} - \hat{\beta}_{(i)})^T (X^T X) (\hat{\beta} - \hat{\beta}_{(i)})}{p \cdot \text{MSE}} \]
где:
- \(p\) — количество коэффициентов модели (включая свободный член);
- \(\text{MSE}\) — среднеквадратичная ошибка модели (оценка дисперсии ошибок \(\sigma^2\)), вычисленная по полной выборке: \(\text{MSE} = \frac{1}{n-p} \sum_{j=1}^n (y_j - \hat{y}_j)^2\).
На практике чаще используется эквивалентная формула, выражающая \(D_i\) через стандартизированные остатки \(e_i\) и «рычаг» \(h_{ii}\):
\[ D_i = \frac{e_i^2}{p \cdot \text{MSE}} \cdot \frac{h_{ii}}{(1 - h_{ii})^2} \]
где:
- \(e_i = y_i - \hat{y}_i\) — остаток для \(i\)-го наблюдения;
- \(h_{ii}\) — диагональный элемент матрицы проекции \(H = X(X^T X)^{-1} X^T\) (hat matrix), который измеряет «рычаг» (леверидж) наблюдения.
¶Интерпретация
Расстояние Кука показывает, насколько изменится вектор всех коэффициентов регрессии, если исключить данное наблюдение. Значение \(D_i\) может быть от 0 до бесконечности. Чем больше \(D_i\), тем большее влияние наблюдение оказывает на модель.
Пороговые значения (эвристические правила):
- Если \(D_i > 1\), наблюдение считается сильно влиятельным и заслуживает пристального изучения.
- Если \(D_i > 4/n\) (где \(n\) — объём выборки), наблюдение может быть признано потенциально влиятельным.
- В некоторых руководствах рекомендуется рассматривать наблюдения с \(D_i > 0.5\) как подозрительные.
Эти пороги не являются строгими статистическими критериями, а служат ориентирами. Влиятельность наблюдения должна оцениваться в контексте конкретной задачи, с учётом содержательного смысла данных.
¶Связь с другими диагностическими мерами
Расстояние Кука объединяет две компоненты:
- Рычаг (леверидж) \(h_{ii}\) — измеряет, насколько значение предиктора для данного наблюдения удалено от среднего. Наблюдения с большим рычагом имеют необычные значения предикторов и могут сильно влиять на наклон регрессии.
- Стандартизированный остаток \(e_i / \sqrt{\text{MSE}}\) — измеряет, насколько сильно наблюдение отклоняется от предсказанного значения модели.
Наблюдение может иметь большое расстояние Кука в трёх случаях:
- Большой остаток (выброс по \(y\)) при умеренном рычаге;
- Большой рычаг (выброс по \(x\)) при умеренном остатке;
- Комбинация умеренных значений обеих компонент.
Другие меры влиятельности:
- DFBETAS — изменение каждого коэффициента по отдельности при удалении наблюдения.
- DFFITS — изменение предсказанного значения для данного наблюдения.
- COVRATIO — изменение ковариационной матрицы оценок.
Расстояние Кука является более общей мерой, так как оценивает суммарное изменение всех коэффициентов.
¶Применение
¶В статистическом моделировании
- Выявление выбросов и влиятельных точек в регрессионном анализе, дисперсионном анализе (ANOVA), обобщённых линейных моделях.
- Диагностика модели после подгонки — обязательный этап проверки адекватности регрессии. Если обнаружены наблюдения с большим \(D_i\), их необходимо исследовать: возможно, это ошибки ввода данных, редкие события или наблюдения, требующие отдельной модели.
- Робастная регрессия — расстояние Кука используется для взвешивания наблюдений или для автоматического удаления влиятельных точек.
¶В машинном обучении
- Анализ влиятельности в линейных моделях (например, в линейной регрессии, гребневой регрессии, LASSO). В нелинейных моделях (деревья решений, нейронные сети) расстояние Кука применяется реже, но существуют его обобщения.
- Обнаружение аномалий — в некоторых задачах (например, в финансах, медицине) точки с высоким \(D_i\) могут указывать на мошеннические операции, редкие заболевания или ошибки измерений.
- Оценка устойчивости модели — если удаление одного наблюдения сильно меняет модель, это свидетельствует о её нестабильности.
¶В конкретных областях
- Эконометрика — анализ влиятельных наблюдений в регрессиях по временным рядам, панельным данным.
- Биостатистика — в клинических исследованиях для выявления пациентов с аномальным ответом на лечение.
- Социология и психология — при обработке опросных данных для выявления респондентов, дающих нетипичные ответы.
¶Пример расчёта (упрощённый)
Рассмотрим простую линейную регрессию \(y = a + bx\) с тремя наблюдениями:
- (1, 2), (2, 3), (10, 10)
По полной выборке: \(\hat{y} = 1.0 + 0.9x\), MSE = 0.33.
Для наблюдения (10, 10):
- Остаток \(e = 10 - (1.0 + 0.9 \cdot 10) = 10 - 10 = 0\);
- Рычаг \(h_{ii}\) для этого наблюдения высок (так как \(x=10\) далеко от среднего \(\bar{x} \approx 4.33\));
- \(D_i \approx 0.6\) — умеренное влияние.
Если бы остаток был ненулевым (например, \(y=12\)), \(D_i\) могло бы превысить 1.
¶Ограничения и критика
- Чувствительность к мультиколлинеарности — при сильной корреляции предикторов расстояние Кука может давать искажённые результаты.
- Неприменимость к нелинейным моделям — в чистом виде формула выведена для линейной регрессии. Для обобщённых линейных моделей, деревьев решений, нейронных сетей существуют аналоги, но они менее стандартизированы.
- Эвристичность порогов — нет строгого статистического обоснования для пороговых значений \(D_i > 1\) или \(D_i > 4/n\). Они основаны на практическом опыте.
- Зависимость от объёма выборки — при малых \(n\) даже одно влиятельное наблюдение может сильно исказить модель, а при больших \(n\) влияние отдельных точек обычно снижается.
- Не различает причину влиятельности — расстояние Кука не показывает, является ли наблюдение выбросом по \(y\) или по \(x\), требуется дополнительный анализ.
¶Реализация в программном обеспечении
Расстояние Кука реализовано во всех основных статистических пакетах и языках программирования:
- R — функция
cooks.distance()в пакетеstats(для объектов классаlm). - Python — метод
cooks_distance()в библиотекеstatsmodels(для результатов регрессии) или ручное вычисление с помощьюscikit-learnиnumpy. - SPSS — опция «Casewise diagnostics» в модуле регрессионного анализа.
- Stata — команда
predict, cooksd. - MATLAB — функция
regressвозвращает вектор расстояний Кука в качестве одного из выходных аргументов.
В большинстве пакетов расстояние Кука автоматически вычисляется при построении регрессионной модели и доступно для визуализации (например, на графике «Residuals vs Leverage»).
¶Интересные факты
- Р. Деннис Кук впоследствии разработал также расстояние Кука для обобщённых линейных моделей (GLM) и для моделей с гетероскедастичностью.
- В некоторых учебниках расстояние Кука называют «мерой Кука» или «статистикой Кука».
- В 1980-х годах расстояние Кука вошло в стандартный набор диагностических процедур для регрессионного анализа, наряду с Q-Q-графиками и тестом Дарбина-Уотсона.
- В эпоху больших данных (Big Data) расстояние Кука потеряло часть своей актуальности для сверхбольших выборок (миллионы наблюдений), где влияние отдельной точки ничтожно, но остаётся важным инструментом в малых и средних выборках, а также в задачах, где каждое наблюдение имеет высокую стоимость (например, клинические испытания).
¶Источники
- Cook, R. D. (1977). «Detection of Influential Observation in Linear Regression». Technometrics, 19(1), 15–18.
- Belsley, D. A., Kuh, E., & Welsch, R. E. (1980). «Regression Diagnostics: Identifying Influential Data and Sources of Collinearity». Wiley.
- Fox, J. (1991). «Regression Diagnostics: An Introduction». Sage Publications.
- Chatterjee, S., & Hadi, A. S. (1986). «Influential Observations, High Leverage Points, and Outliers in Linear Regression». Statistical Science, 1(3), 379–393.
- Montgomery, D. C., Peck, E. A., & Vining, G. G. (2012). «Introduction to Linear Regression Analysis» (5th ed.). Wiley.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


