Открыть сервис

F1-мера: метрика качества классификации

F1-мера (F1-score, F-мера) — метрика качества бинарной классификации, представляющая собой среднее гармоническое между точностью (precision) и полнотой (recall). F1-мера принимает значения от 0 до 1, где 1 соответствует идеальной классификации, а 0 — полному несовпадению прогнозов с реальными метками. Метрика широко применяется в задачах машинного обучения, информационного поиска и обработки естественного языка для оценки эффективности моделей на несбалансированных выборках.

Определение и математическая формула

F1-мера вычисляется как гармоническое среднее точности и полноты:

F1 = 2 × (Precision × Recall) / (Precision + Recall)

Гармоническое среднее, в отличие от арифметического, штрафует модель за сильный дисбаланс между точностью и полнотой. Если одна из метрик близка к нулю, F1-мера также стремится к нулю, даже если вторая метрика высокая. Это свойство делает F1-меру чувствительной к моделям, которые «перекашиваются» в сторону одного из показателей.

Для вычисления F1-меры используются четыре базовых показателя, формирующих матрицу ошибок (confusion matrix):

  • TP (True Positives) — истинно положительные: объекты положительного класса, верно предсказанные моделью;
  • FP (False Positives) — ложноположительные: объекты отрицательного класса, ошибочно отнесённые к положительному;
  • FN (False Negatives) — ложноотрицательные: объекты положительного класса, ошибочно отнесённые к отрицательному;
  • TN (True Negatives) — истинно отрицательные: объекты отрицательного класса, верно предсказанные.

Точность определяется как TP / (TP + FP) — доля верно предсказанных положительных объектов среди всех объектов, которые модель отнесла к положительному классу. Полнота вычисляется как TP / (TP + FN) — доля найденных положительных объектов среди всех реально положительных объектов выборки.

Разновидности F-меры

Fβ-мера

Обобщением F1-меры является Fβ-мера, позволяющая задать приоритет точности или полноты через весовой коэффициент β:

Fβ = (1 + β²) × (Precision × Recall) / (β² × Precision + Recall)

При β = 1 метрика совпадает с F1-мерой. При β > 1 полнота считается более важной, при β < 1 — точность. Fβ-мера применяется в задачах, где цена ошибок разных типов неодинакова: например, в медицинской диагностике важнее не пропустить заболевание (высокая полнота), а в антиспам-фильтрах — не удалить важное письмо (высокая точность).

Макро- и микро-усреднение

В задачах мультиклассовой классификации F1-мера вычисляется двумя основными способами. При макро-усреднении метрика рассчитывается для каждого класса отдельно, после чего берётся среднее арифметическое — каждый класс получает равный вес независимо от числа объектов. При микро-усреднении все TP, FP и FN суммируются по всем классам, и метрика вычисляется на суммарных значениях — классы с большим числом объектов вносят больший вклад. Дополнительно существует взвешенное макро-усреднение, где веса пропорциональны числу объектов в классах.

Свойства и интерпретация

F1-мера обладает рядом свойств, определяющих её применение:

  • Несимметричность к классам: метрика ориентирована на положительный класс. При перестановке меток классов значение может измениться, если распределение объектов неравномерно.
  • Устойчивость к несбалансированным выборкам: в отличие от accuracy (доли верных ответов), F1-мера не завышается на выборках с сильным перекосом классов. Например, если 95% объектов относятся к отрицательному классу, модель, предсказывающая всегда отрицательный класс, получит accuracy 0,95, но F1-мера будет равна нулю из-за нулевой полноты.
  • Диапазон значений: от 0 (нет ни одного верного положительного предсказания) до 1 (идеальная точность и полнота).

Применение

F1-мера используется преимущественно в задачах, где положительный класс представляет интерес для исследователя:

  • Поиск информации: оценка качества поисковых систем и ранжирования. Метрика применяется для оценки способности системы находить релевантные документы (полнота) и не выдавать нерелевантные (точность).
  • Обработка естественного языка: оценка систем извлечения именованных сущностей, машинного перевода, анализа тональности. В задачах распознавания речи и машинного перевода также используется метрика BLEU, основанная на схожих принципах.
  • Медицинская диагностика: оценка моделей выявления заболеваний по медицинским изображениям и анализам, где ложноположительные и ложноотрицательные ошибки имеют разную клиническую значимость.
  • Компьютерное зрение: оценка детекции объектов, сегментации изображений (в форме IoU-метрики, родственной F1-мере).
  • Кредитный скоринг: оценка моделей выявления потенциальных неплательщиков.

Сравнение с другими метриками

F1-мера не является универсальной метрикой и в ряде случаев уступает альтернативным показателям. Accuracy (доля верных ответов) проста в интерпретации, но вводит в заблуждение на несбалансированных данных. AUC-ROC (площадь под ROC-кривой) оценивает модель при всех возможных порогах классификации и не зависит от выбранного порога, тогда как F1-мера соответствует конкретному порогу. При этом AUC-ROC менее чувствительна к несбалансированности выборок, но сложнее в интерпретации для бизнес-задач. Метрика Matthews Correlation Coefficient (MCC) учитывает все четыре ячейки матрицы ошибок и считается более информативной при сильном дисбалансе классов.

Выбор метрики зависит от конкретной задачи: если важна одинаковая цена ошибок обоих типов, применяют accuracy или MCC; если критично найти максимум положительных объектов — полноту; если важна достоверность найденных объектов — точность. F1-мера выбирается, когда требуется сбалансированная оценка, а классы неравномерны.

Ограничения и критика

Основное ограничение F1-меры — игнорирование истинно отрицательных результатов (TN). Метрика не учитывает, насколько хорошо модель распознаёт отрицательный класс, что может быть критично в некоторых приложениях. Дополнительно F1-мера чувствительна к выбору порога классификации: изменение порога вероятности, при котором объект относится к положительному классу, может существенно изменить значение метрики.

В научном сообществе высказывалась критика чрезмерного использования F1-меры в ущерб более информативным метрикам. В частности, исследователи Дэвид Хэнд и Роберт Тилль в работе 2001 года показали, что F1-мера может давать вводящие в заблуждение результаты при сравнении классификаторов, и рекомендовали использовать метрики, учитывающие все элементы матрицы ошибок.

Источники

  • Sasaki Y. The truth of the F-measure // School of Computer Science, University of Manchester. — 2007.
  • Powers D. M. W. Evaluation: From Precision, Recall and F-measure to ROC, Informedness, Markedness & Correlation // Journal of Machine Learning Technologies. — 2011.
  • Hand D. J., Till R. J. A Simple Generalisation of the Area Under the ROC Curve for Multiple Class Classification Problems // Machine Learning. — 2001.
  • Чикина Е. Д. Метрики качества бинарной классификации // Научно-технический вестник Поволжья. — 2021.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →