Метод Тьюки
Метод Тьюки (также известный как метод Тьюки для обнаружения выбросов) — это статистическая процедура, основанная на межквартильном размахе (IQR), предназначенная для идентификации потенциальных выбросов в наборе одномерных данных. Разработан американским математиком и статистиком Джоном Тьюки в 1970-х годах. Метод не предполагает нормального распределения данных и является непараметрическим, что делает его устойчивым к асимметрии и наличию крайних значений.
История
Джон Уайлдер Тьюки (1915–2000) внёс значительный вклад в развитие статистики, включая создание быстрого преобразования Фурье и методов разведочного анализа данных. В 1977 году он опубликовал книгу «Exploratory Data Analysis» («Разведочный анализ данных»), в которой впервые систематически описал метод Тьюки для выявления выбросов. Книга стала основой для современного подхода к визуализации и предварительному анализу данных, а метод Тьюки — одним из самых распространённых способов обнаружения аномалий.
До появления метода Тьюки выбросы часто определяли по правилу «трёх сигм» (3σ), предполагающему нормальное распределение. Метод Тьюки предложил альтернативу, не требующую нормальности, что сделало его применимым к широкому кругу реальных данных, включая распределения с длинными хвостами.
Алгоритм метода
Метод Тьюки использует квартили и межквартильный размах для определения границ, за пределами которых значения считаются потенциальными выбросами.
Определение квартилей
- Первый квартиль (Q1) — значение, ниже которого находятся 25% данных.
- Третий квартиль (Q3) — значение, ниже которого находятся 75% данных.
- Межквартильный размах (IQR) = Q3 – Q1.
Вычисление границ
- Нижняя граница (внутренний забор) = Q1 – 1,5 × IQR.
- Верхняя граница (внутренний забор) = Q3 + 1,5 × IQR.
- Внешние границы (внешние заборы) = Q1 – 3 × IQR и Q3 + 3 × IQR.
Классификация выбросов
- Умеренные выбросы (outliers) — точки, лежащие между 1,5 × IQR и 3 × IQR от квартилей.
- Крайние выбросы (far outliers) — точки, лежащие за пределами 3 × IQR.
Значения, попадающие за внешние границы, часто рассматриваются как более серьёзные аномалии, требующие особого внимания.
Пример
Рассмотрим набор данных: [5, 7, 8, 9, 10, 12, 14, 15, 100].
- Упорядочим: [5, 7, 8, 9, 10, 12, 14, 15, 100].
- Q1 = 7,5 (среднее между 7 и 8), Q3 = 14,5 (среднее между 14 и 15), IQR = 14,5 – 7,5 = 7.
- Нижняя граница = 7,5 – 1,5 × 7 = 7,5 – 10,5 = –3.
- Верхняя граница = 14,5 + 1,5 × 7 = 14,5 + 10,5 = 25.
- Значение 100 > 25, следовательно, является умеренным выбросом (так как 100 > 25, но меньше 14,5 + 3 × 7 = 35,5? Проверка: 3 × IQR = 21, внешняя граница = 14,5 + 21 = 35,5. 100 > 35,5, значит, это крайний выброс).
Таким образом, метод Тьюки однозначно идентифицирует значение 100 как аномалию.
Применение
Метод Тьюки широко используется в различных областях:
- Анализ данных и машинное обучение — для очистки данных от выбросов перед обучением моделей.
- Финансовый анализ — для выявления аномальных транзакций или резких колебаний цен.
- Медицинская статистика — для обнаружения необычных значений биомаркеров или результатов анализов.
- Контроль качества — для идентификации бракованных изделий.
- Социологические исследования — для фильтрации некорректных ответов респондентов.
Метод часто используется в сочетании с ящиками с усами (box plots), где выбросы отображаются точками за пределами усов.
Преимущества и недостатки
Преимущества
- Непараметричность — не требует нормального распределения.
- Простота — легко вычисляется и интерпретируется.
- Устойчивость — квартили менее чувствительны к крайним значениям, чем среднее и стандартное отклонение.
- Наглядность — хорошо визуализируется на ящичных диаграммах.
Недостатки
- Зависимость от размера выборки — при малых выборках границы могут быть неточными.
- Чувствительность к мультимодальности — если данные имеют несколько мод, метод может ошибочно классифицировать нормальные значения как выбросы.
- Не учитывает контекст — выброс может быть значимым, а не ошибкой (например, всплеск продаж в праздничный день).
- Коэффициент 1,5 — эмпирический, не всегда оптимален для конкретного набора данных.
Модификации
Для повышения точности метода Тьюки были предложены различные модификации:
- Адаптивный коэффициент — вместо фиксированного 1,5 используется коэффициент, зависящий от размера выборки или асимметрии.
- Метод Тьюки с логарифмированием — применяется к логарифмированным данным для уменьшения влияния асимметрии.
- Комбинированный метод — сочетает метод Тьюки с другими подходами, например, с Z-оценкой.
Связь с другими методами
Метод Тьюки является частным случаем более общего подхода к обнаружению выбросов на основе квантилей. Он также тесно связан с:
- Правилом трёх сигм — для нормальных данных даёт похожие результаты, но менее устойчив.
- Методом Хэмпеля — использует медиану и медианное абсолютное отклонение (MAD).
- Методом Граббса — параметрический тест, предполагающий нормальность.
Интересные факты
- Джон Тьюки также известен как создатель термина «бит» (binary digit) и соавтор быстрого преобразования Фурье.
- Метод Тьюки лёг в основу популярного алгоритма Isolation Forest для обнаружения аномалий в многомерных данных.
- В некоторых программных пакетах (например, R, Python с библиотекой SciPy) метод Тьюки реализован как стандартная функция для выявления выбросов.
Критика
Основная критика метода Тьюки связана с произвольным выбором коэффициента 1,5. В некоторых случаях это приводит к тому, что выбросами признаются до 5–10% данных, что может быть избыточным. Кроме того, метод не учитывает корреляционную структуру данных и не применим к многомерным случаям без дополнительной обработки.
Источники
- Tukey, J. W. (1977). Exploratory Data Analysis. Addison-Wesley.
- Hoaglin, D. C., Mosteller, F., & Tukey, J. W. (1983). Understanding Robust and Exploratory Data Analysis.
- Rousseeuw, P. J., & Leroy, A. M. (1987). Robust Regression and Outlier Detection.
- Стандартные руководства по статистическому анализу в Python (scipy.stats) и R (boxplot.stats).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


