Открыть сервис

Обучение с учителем

Обучение с учителем (англ. supervised learning) — это парадигма машинного обучения, в которой модель обучается на размеченном наборе данных, где для каждого входного объекта известен правильный ответ (целевая переменная). Целью обучения является построение функции, которая по новым, ранее не виденным данным может предсказывать целевые значения с минимальной ошибкой. Обучение с учителем противопоставляется обучению без учителя (где данные не размечены) и обучению с частичным привлечением учителя (полуконтролируемое обучение).

История

Истоки обучения с учителем восходят к середине XX века, когда были разработаны первые алгоритмы, способные обучаться на примерах. В 1957 году Фрэнк Розенблатт представил перцептрон — простейшую нейронную сеть, способную решать задачи бинарной классификации. В 1960-х годах появились методы линейной регрессии и ближайших соседей, а в 1970-х — деревья решений и метод опорных векторов (SVM). Значительный прогресс в 1980-х годах связан с развитием алгоритмов обратного распространения ошибки для многослойных нейронных сетей. С 2000-х годов, благодаря росту вычислительных мощностей и доступности больших размеченных наборов данных, обучение с учителем стало основой для многих прикладных систем, включая распознавание изображений, обработку естественного языка и рекомендательные системы.

Основные понятия

Размеченные данные

Размеченный набор данных (обучающая выборка) состоит из пар $(x_i, y_i)$, где $x_i$ — вектор признаков (входные данные), а $y_i$ — целевая переменная (метка). Например, в задаче распознавания рукописных цифр $x_i$ может быть матрицей пикселей изображения, а $y_i$ — числом от 0 до 9.

Функция потерь

Функция потерь (loss function) количественно оценивает разницу между предсказанием модели $\hat{y}_i$ и истинным значением $y_i$. Цель обучения — минимизировать среднее значение функции потерь на обучающей выборке. Для задач регрессии часто используется среднеквадратичная ошибка (MSE), для классификации — кросс-энтропия.

Обобщающая способность

Ключевое свойство модели — способность правильно предсказывать на новых, не участвовавших в обучении данных. Это называется обобщающей способностью. Переобучение (overfitting) возникает, когда модель слишком точно запоминает обучающие данные, но плохо работает на новых. Недообучение (underfitting) — когда модель недостаточно сложна, чтобы уловить закономерности.

Типы задач

Классификация

В задачах классификации целевая переменная принимает конечное число дискретных значений (классов). Примеры:

Регрессия

В задачах регрессии целевая переменная является непрерывной величиной. Примеры:

Алгоритмы обучения с учителем

Линейные модели

  • Линейная регрессия: предполагает линейную зависимость между признаками и целевой переменной. Оценка параметров производится методом наименьших квадратов.
  • Логистическая регрессия: несмотря на название, используется для бинарной классификации. Модель вычисляет вероятность принадлежности к классу с помощью логистической функции (сигмоиды).
  • Метод опорных векторов (SVM): строит разделяющую гиперплоскость с максимальным зазором между классами. Эффективен для задач с небольшим числом признаков.

Деревья решений и ансамбли

  • Деревья решений: рекурсивно разбивают пространство признаков на области, в каждой из которых предсказывается одно значение. Просты для интерпретации, но склонны к переобучению.
  • Случайный лес: ансамбль из множества деревьев решений, каждое из которых обучается на случайной подвыборке данных и признаков. Усреднение их предсказаний снижает переобучение и повышает точность.
  • Градиентный бустинг: последовательное построение деревьев, где каждое новое дерево исправляет ошибки предыдущих. Реализации: XGBoost, LightGBM, CatBoost.

Нейронные сети

  • Многослойный перцептрон (MLP): полносвязная нейронная сеть с одним или несколькими скрытыми слоями. Обучается с помощью алгоритма обратного распространения ошибки.
  • Свёрточные нейронные сети (CNN): специализированы для обработки данных с сетчатой структурой (изображения, видео). Используют свёрточные слои для выделения пространственных признаков.
  • Рекуррентные нейронные сети (RNN): предназначены для последовательных данных (текст, временные ряды). Учитывают предыдущие состояния с помощью скрытых состояний и механизмов памяти (LSTM, GRU).

Методы на основе расстояний

  • k-ближайших соседей (k-NN): для нового объекта предсказание определяется по большинству классов (или среднему значению) среди k ближайших точек обучающей выборки. Не требует обучения, но медленно работает на больших наборах данных.
  • Метод опорных векторов с ядром: позволяет строить нелинейные разделяющие поверхности за счёт использования ядровой функции (например, радиальная базисная функция).

Оценка качества модели

Метрики для классификации

  • Accuracy (точность): доля правильных предсказаний среди всех. Не подходит для несбалансированных классов.
  • Precision (точность) и Recall (полнота): precision — доля истинно положительных среди всех предсказанных положительных; recall — доля истинно положительных среди всех действительных положительных.
  • F1-мера: гармоническое среднее precision и recall.
  • ROC-AUC: площадь под кривой ошибок, показывает способность модели разделять классы при разных порогах.

Метрики для регрессии

  • Среднеквадратичная ошибка (MSE): среднее квадратов разностей предсказанных и истинных значений. Чувствительна к выбросам.
  • Средняя абсолютная ошибка (MAE): среднее абсолютных разностей. Менее чувствительна к выбросам.
  • Коэффициент детерминации (R²): доля дисперсии целевой переменной, объяснённая моделью. Принимает значения от 0 до 1 (чем ближе к 1, тем лучше).

Перекрёстная проверка

Для оценки обобщающей способности и предотвращения переобучения используется перекрёстная проверка (cross-validation). Данные разбиваются на k частей (фолдов), модель обучается на k-1 частях и тестируется на оставшейся, процедура повторяется k раз. Средняя метрика по всем фолдам даёт более надёжную оценку.

Применение

Обучение с учителем широко применяется в различных областях:

  • Медицина: диагностика заболеваний по медицинским изображениям (рентген, МРТ), прогнозирование риска развития болезней.
  • Финансы: кредитный скоринг, обнаружение мошеннических транзакций, прогнозирование цен акций.
  • Рекомендательные системы: предсказание предпочтений пользователей на основе их истории (Netflix, Amazon).
  • Обработка естественного языка: анализ тональности текстов, машинный перевод, распознавание речи.
  • Автономные системы: распознавание дорожных знаков, пешеходов и препятствий в беспилотных автомобилях.

Ограничения и критика

  • Зависимость от размеченных данных: создание качественной разметки требует больших затрат времени и ресурсов, особенно в специализированных областях (медицина, геология).
  • Проблема несбалансированных классов: если один класс встречается значительно реже других, модель может игнорировать его, что приводит к низкой полноте.
  • Переобучение: сложные модели (глубокие нейронные сети) легко запоминают шум в данных, если не используются методы регуляризации (L1, L2, dropout).
  • Интерпретируемость: многие мощные модели (ансамбли, глубокие нейронные сети) являются «чёрными ящиками», что затрудняет понимание причин их решений.
  • Смещение и справедливость: если обучающие данные содержат исторические предубеждения (например, по полу или расе), модель может воспроизводить и усиливать эти смещения.

Источники

  • Hastie, T., Tibshirani, R., Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction. Springer.
  • Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
  • Goodfellow, I., Bengio, Y., Courville, A. (2016). Deep Learning. MIT Press.
  • Национальный стандарт РФ ГОСТ Р 58768-2019 «Интеллектуальные системы. Машинное обучение. Термины и определения».
  • Лекции курса «Машинное обучение» (ВШЭ, Яндекс.Школа анализа данных).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →