F-метрика в оценке качества¶
F-мера (также F-метрика, F1-мера, F-score) — скалярная метрика качества, применяемая в машинном обучении, информационном поиске и статистической классификации для оценки точности бинарных и многоклассовых моделей. Она объединяет две базовые характеристики — точность (precision) и полноту (recall) — в одно число через их гармоническое среднее, что позволяет учитывать оба типа ошибок одновременно.
¶Определение и формула
Пусть модель предсказывает принадлежность объектов к целевому классу. Тогда:
- TP (true positive) — верно предсказанные положительные объекты;
- FP (false positive) — объекты, ошибочно отнесённые к положительным;
- FN (false negative) — положительные объекты, пропущенные моделью.
Точность и полнота определяются как:
- Precision = TP / (TP + FP);
- Recall = TP / (TP + FN).
Общая формула F-меры имеет вид:
F_β = (1 + β²) · (Precision · Recall) / (β² · Precision + Recall).
При β = 1 получается классическая F1-мера — гармоническое среднее точности и полноты:
F1 = 2 · Precision · Recall / (Precision + Recall).
Гармоническое среднее выбрано не случайно: в отличие от арифметического, оно резко падает, если хотя бы одна из компонент близка к нулю. Модель, дающая высокую точность при нулевой полноте, получит F1, близкую к нулю.
¶Параметр β и его смысл
Параметр β задаёт вес полноты относительно точности:
- β < 1 (например, F0.5) — приоритет точности; применяется там, где ложные срабатывания дороже пропусков (спам-фильтры, антифрод);
- β = 1 — сбалансированный вариант;
- β > 1 (например, F2) — приоритет полноты; используется в медицинской диагностике, поиске дефектов, где пропуск цели критичнее лишнего срабатывания.
¶Связь с другими метриками
F1 связана с коэффициентом Жаккара (IoU) соотношением F1 = 2·IoU / (1 + IoU), что делает её удобной в задачах сегментации и детекции объектов. Также F-мера является частным случаем коэффициента Dice. В отличие от accuracy, она устойчива к сильному дисбалансу классов: при доле положительных объектов 1 % модель, всегда предсказывающая «отрицательный» класс, даст accuracy 99 %, но F1 = 0.
¶Многоклассовый случай
Для задач с несколькими классами применяются усреднения:
| Способ | Описание |
|---|---|
| Macro-F1 | F1 считается для каждого класса, затем берётся невзвешенное среднее |
| Micro-F1 | Считаются суммарные TP, FP, FN по всем классам, затем вычисляется F1 |
| Weighted-F1 | Среднее F1 по классам с весами, пропорциональными их частоте |
Micro-F1 совпадает с accuracy в случае, когда каждый объект принадлежит ровно одному классу. Macro-F1 чувствителен к редким классам и потому часто используется в задачах с несбалансированными категориями.
¶Применение
F-мера широко применяется в следующих областях:
- Информационный поиск — оценка качества ранжирования и поисковых систем (в связке с MAP, nDCG);
- Обработка естественного языка — распознавание именованных сущностей, машинный перевод, извлечение отношений;
- Компьютерное зрение — детекция и сегментация объектов;
- Медицина — оценка диагностических систем, где важен баланс между пропусками и ложными тревогами;
- Биоинформатика — сравнение предсказанных и реальных структур белков, генов.
В российских исследованиях и инженерных задачах F1-мера используется, в частности, при оценке систем автоматической обработки текстов на русском языке, в задачах антиспама и в соревнованиях по анализу данных.
¶Ограничения и критика
Несмотря на популярность, F-мера имеет ряд недостатков:
- Не учитывает истинно отрицательные срабатывания (TN) — в задачах, где важно распознавание «нормы», она может вводить в заблуждение;
- Не отражает порог принятия решения — одно значение F1 не показывает, как модель ведёт себя при изменении порога; для этого строят кривые precision-recall;
- Чувствительность к способу усреднения — macro-, micro- и weighted-варианты могут давать существенно разные значения на одних и тех же данных;
- Не является «истинной» вероятностной метрикой — она не калибрована и не интерпретируется как вероятность.
По этим причинам F1 обычно используется в комплексе с другими метриками: матрицей ошибок, ROC-AUC, PR-AUC и калибровочными кривыми.
¶История
Концепция восходит к работе британского учёного Кита ван Рейсбергена (1979), который ввёл меру эффективности (effectiveness measure) E = 1 − F для оценки информационно-поисковых систем. Обозначение F_β закрепилось в 1990-х годах в рамках конференций по информационному поиску (TREC) и последующих работ по машинному обучению. С тех пор F1 стала одной из стандартных метрик де-факто.
Источники: van Rijsbergen C. J. Information Retrieval; Manning C., Raghavan P., Schütze H. Introduction to Information Retrieval; материалы конференций TREC; документация библиотек scikit-learn и torchmetrics.