Открыть сервис

C-статистика Гири

C-статистика Гири (также известная как коэффициент концентрации Джини, хотя это не совсем корректно) — это показатель неравенства распределения, используемый в статистике и эконометрике для оценки степени дискриминационной способности бинарных классификационных моделей. В отличие от одноимённого коэффициента Джини, применяемого для измерения неравенства доходов, C-статистика оценивает, насколько хорошо модель разделяет объекты на два класса (например, «событие» и «не-событие»). Она численно равна площади под ROC-кривой (AUC — Area Under the Curve) и принимает значения от 0,5 до 1,0, где 0,5 соответствует случайному угадыванию, а 1,0 — идеальному разделению.

История и происхождение

Понятие C-статистики возникло в контексте развития методов оценки качества прогнозных моделей в середине XX века. В 1950-х годах статистики начали использовать ROC-кривые (Receiver Operating Characteristic) для анализа эффективности радиолокационных систем, а затем и для медицинской диагностики. В 1970-х годах метод был адаптирован для оценки регрессионных моделей, особенно в логистической регрессии. Термин «C-статистика» (от англ. concordance — согласованность) ввёл в обиход американский статистик Фрэнк Харрелл (Frank Harrell) в 1980-х годах, акцентируя внимание на доле пар объектов, правильно упорядоченных моделью. В России и странах бывшего СССР этот показатель часто называют «индексом согласия» или «коэффициентом конкордации».

Определение и математическая основа

C-статистика определяется как вероятность того, что для случайно выбранной пары объектов из разных классов (один с положительным исходом, другой с отрицательным) модель присвоит более высокий прогнозируемый балл объекту с положительным исходом. Формально:

\[ C = \frac{\text{Число согласованных пар} + 0{,}5 \times \text{Число связанных пар}}{\text{Общее число пар}} \]

Где:

  • Согласованная пара — пара, в которой прогнозируемая вероятность для объекта с положительным исходом выше, чем для объекта с отрицательным.
  • Связанная пара — пара, в которой прогнозируемые вероятности равны.
  • Общее число пар — произведение количества объектов с положительным и отрицательным исходами.

Математически C-статистика эквивалентна площади под ROC-кривой (AUC), которая строится в координатах «чувствительность» (True Positive Rate) — «специфичность» (False Positive Rate). Это свойство делает её удобной для интерпретации: чем ближе значение к 1, тем выше дискриминационная способность модели.

Свойства и интерпретация

C-статистика обладает рядом важных свойств:

  • Диапазон значений: от 0,5 (модель не лучше случайного угадывания) до 1,0 (идеальная модель). Значения ниже 0,5 указывают на обратную зависимость (модель систематически ошибается).
  • Независимость от порога: в отличие от точности, чувствительности или специфичности, C-статистика не зависит от выбранного порога классификации, что делает её объективной мерой для сравнения моделей.
  • Инвариантность к монотонным преобразованиям: если прогнозируемые баллы модели преобразовать монотонной функцией (например, логарифмированием), C-статистика не изменится.

Шкала интерпретации (по Хосмеру и Лемешоу):

  • 0,5–0,7 — низкая дискриминационная способность (модель практически бесполезна);
  • 0,7–0,8 — приемлемая способность;
  • 0,8–0,9 — отличная способность;
  • 0,9–1,0 — выдающаяся способность (редко встречается на практике, часто указывает на переобучение).

Применение

C-статистика широко используется в различных областях, где требуется оценка качества бинарных классификаторов:

Медицина и эпидемиология

В клинических исследованиях C-статистика применяется для оценки прогностических моделей, например, для предсказания риска развития сердечно-сосудистых заболеваний (шкала SCORE, Фрамингемская шкала), вероятности рецидива рака или эффективности лечения. Врачи и исследователи используют её для сравнения диагностических тестов и моделей риска.

Финансы и кредитный скоринг

В банковской сфере C-статистика является стандартным показателем качества скоринговых моделей, оценивающих вероятность дефолта заёмщика. Значение выше 0,75 обычно считается приемлемым для кредитного скоринга. Регуляторы, такие как Банк России, рекомендуют использовать C-статистику при валидации внутренних рейтинговых систем.

Маркетинг и анализ клиентской базы

В маркетинге C-статистика помогает оценить модели оттока клиентов (churn), вероятности покупки или отклика на рекламную кампанию. Модели с высокой C-статистикой позволяют точнее таргетировать маркетинговые усилия.

Машинное обучение и data science

В задачах бинарной классификации (например, спам-фильтрация, обнаружение мошенничества, распознавание изображений) C-статистика используется как метрика для выбора лучшей модели среди множества алгоритмов (логистическая регрессия, случайный лес, градиентный бустинг, нейронные сети). Она особенно полезна при несбалансированных классах, когда точность может быть обманчивой.

Ограничения и критика

Несмотря на широкое применение, C-статистика имеет ряд ограничений:

  • Нечувствительность к калибровке: C-статистика оценивает только ранжирование объектов, но не точность прогнозируемых вероятностей. Модель может иметь высокую C-статистику, но систематически завышать или занижать вероятности (плохая калибровка).
  • Зависимость от распределения классов: при сильном дисбалансе классов (например, 99% отрицательных и 1% положительных) C-статистика может быть завышена, так как большинство пар оказываются согласованными тривиально.
  • Неприменимость для многоклассовой классификации: в исходном виде C-статистика работает только для двух классов. Для многоклассовых задач используются обобщения, такие как макро- и микро-усреднённые AUC.
  • Сравнение моделей на разных выборках: C-статистика чувствительна к составу выборки, поэтому сравнение моделей должно проводиться на одинаковых данных.

Альтернативные показатели

Для более полной оценки модели C-статистику часто дополняют другими метриками:

  • Индекс Брауна (Brier score) — оценивает калибровку прогнозов;
  • Коэффициент Джини (Gini coefficient) — линейное преобразование C-статистики: Gini = 2 × C − 1;
  • Kappa-статистика Коэна — учитывает согласие с учётом случайности;
  • Кривая подъёма (Lift curve) — показывает прирост эффективности по сравнению со случайным отбором.

Интересные факты

  • В некоторых источниках C-статистику ошибочно называют «коэффициентом Джини» для моделей, хотя это разные показатели. Коэффициент Джини для неравенства доходов рассчитывается иначе и не связан с ROC-кривой.
  • В 2010-х годах с развитием машинного обучения C-статистика стала одной из стандартных метрик в библиотеках scikit-learn (Python) и caret (R), где она реализована как roc_auc_score.
  • В медицинской статистике C-статистика часто используется в сочетании с калибровочными графиками (calibration plots) для всесторонней оценки прогностических моделей.

Источники

  • Harrell F. E. Regression Modeling Strategies: With Applications to Linear Models, Logistic and Ordinal Regression, and Survival Analysis. — Springer, 2015.
  • Hosmer D. W., Lemeshow S., Sturdivant R. X. Applied Logistic Regression. — Wiley, 2013.
  • Fawcett T. An Introduction to ROC Analysis // Pattern Recognition Letters. — 2006. — Vol. 27, No. 8. — P. 861–874.
  • Банк России. Методические рекомендации по валидации внутренних рейтинговых систем кредитных организаций. — 2018.
  • scikit-learn documentation: ROC AUC score. — https://scikit-learn.org/stable/modules/generated/sklearn.metrics.roc_auc_score.html