Открыть сервисСервис

F-метрика в оценке качества

F-мера (также F-метрика, F1-мера, F-score) — скалярная метрика качества, применяемая в машинном обучении, информационном поиске и статистической классификации для оценки точности бинарных и многоклассовых моделей. Она объединяет две базовые характеристики — точность (precision) и полноту (recall) — в одно число через их гармоническое среднее, что позволяет учитывать оба типа ошибок одновременно.

Определение и формула

Пусть модель предсказывает принадлежность объектов к целевому классу. Тогда:

  • TP (true positive) — верно предсказанные положительные объекты;
  • FP (false positive) — объекты, ошибочно отнесённые к положительным;
  • FN (false negative) — положительные объекты, пропущенные моделью.

Точность и полнота определяются как:

  • Precision = TP / (TP + FP);
  • Recall = TP / (TP + FN).

Общая формула F-меры имеет вид:

F_β = (1 + β²) · (Precision · Recall) / (β² · Precision + Recall).

При β = 1 получается классическая F1-мера — гармоническое среднее точности и полноты:

F1 = 2 · Precision · Recall / (Precision + Recall).

Гармоническое среднее выбрано не случайно: в отличие от арифметического, оно резко падает, если хотя бы одна из компонент близка к нулю. Модель, дающая высокую точность при нулевой полноте, получит F1, близкую к нулю.

Параметр β и его смысл

Параметр β задаёт вес полноты относительно точности:

  • β < 1 (например, F0.5) — приоритет точности; применяется там, где ложные срабатывания дороже пропусков (спам-фильтры, антифрод);
  • β = 1 — сбалансированный вариант;
  • β > 1 (например, F2) — приоритет полноты; используется в медицинской диагностике, поиске дефектов, где пропуск цели критичнее лишнего срабатывания.

Связь с другими метриками

F1 связана с коэффициентом Жаккара (IoU) соотношением F1 = 2·IoU / (1 + IoU), что делает её удобной в задачах сегментации и детекции объектов. Также F-мера является частным случаем коэффициента Dice. В отличие от accuracy, она устойчива к сильному дисбалансу классов: при доле положительных объектов 1 % модель, всегда предсказывающая «отрицательный» класс, даст accuracy 99 %, но F1 = 0.

Многоклассовый случай

Для задач с несколькими классами применяются усреднения:

СпособОписание
Macro-F1F1 считается для каждого класса, затем берётся невзвешенное среднее
Micro-F1Считаются суммарные TP, FP, FN по всем классам, затем вычисляется F1
Weighted-F1Среднее F1 по классам с весами, пропорциональными их частоте

Micro-F1 совпадает с accuracy в случае, когда каждый объект принадлежит ровно одному классу. Macro-F1 чувствителен к редким классам и потому часто используется в задачах с несбалансированными категориями.

Применение

F-мера широко применяется в следующих областях:

В российских исследованиях и инженерных задачах F1-мера используется, в частности, при оценке систем автоматической обработки текстов на русском языке, в задачах антиспама и в соревнованиях по анализу данных.

Ограничения и критика

Несмотря на популярность, F-мера имеет ряд недостатков:

  • Не учитывает истинно отрицательные срабатывания (TN) — в задачах, где важно распознавание «нормы», она может вводить в заблуждение;
  • Не отражает порог принятия решения — одно значение F1 не показывает, как модель ведёт себя при изменении порога; для этого строят кривые precision-recall;
  • Чувствительность к способу усреднения — macro-, micro- и weighted-варианты могут давать существенно разные значения на одних и тех же данных;
  • Не является «истинной» вероятностной метрикой — она не калибрована и не интерпретируется как вероятность.

По этим причинам F1 обычно используется в комплексе с другими метриками: матрицей ошибок, ROC-AUC, PR-AUC и калибровочными кривыми.

История

Концепция восходит к работе британского учёного Кита ван Рейсбергена (1979), который ввёл меру эффективности (effectiveness measure) E = 1 − F для оценки информационно-поисковых систем. Обозначение F_β закрепилось в 1990-х годах в рамках конференций по информационному поиску (TREC) и последующих работ по машинному обучению. С тех пор F1 стала одной из стандартных метрик де-факто.

Источники: van Rijsbergen C. J. Information Retrieval; Manning C., Raghavan P., Schütze H. Introduction to Information Retrieval; материалы конференций TREC; документация библиотек scikit-learn и torchmetrics.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru