Открыть сервис

Рекомендательные системы и их применение

Рекомендательная система (англ. recommender system) — это класс алгоритмов и программных средств, предназначенных для прогнозирования предпочтений пользователя и предложения релевантных объектов (товаров, услуг, контента) на основе анализа исторических данных, поведенческих паттернов и контекстной информации. Рекомендательные системы являются подклассом систем фильтрации информации и широко применяются в электронной коммерции, стриминговых сервисах, социальных сетях и других цифровых платформах.

История развития

Первые концепции автоматической фильтрации информации появились в 1970-х годах в рамках исследований в области информационного поиска. Одной из первых систем, использующих принцип коллективной фильтрации, стала система Tapestry, разработанная в исследовательском центре Xerox PARC в 1992 году. Она позволяла сотрудникам компании помечать документы как релевантные или нерелевантные, после чего система использовала эти оценки для фильтрации входящих сообщений.

В 1994 году группа исследователей Массачусетского технологического института представила систему GroupLens, которая применяла алгоритмы коллаборативной фильтрации для рекомендации новостных статей в сети Usenet. Эта работа заложила теоретические основы современных рекомендательных алгоритмов. В 1997 году компания Amazon запатентовала технологию «покупки, связанные с покупками» (item-to-item collaborative filtering), что стало коммерческим прорывом в области персонализации.

С 2000-х годов рекомендательные системы стали неотъемлемой частью крупнейших интернет-платформ — Netflix, YouTube, Spotify, а также российских сервисов «Яндекс», «Кинопоиск» и VK. В 2006 году компания Netflix объявила конкурс Netflix Prize с призовым фондом 1 миллион долларов за улучшение точности рекомендаций на 10 %, что стимулировало значительный прогресс в разработке алгоритмов матричной факторизации.

Классификация методов

Контентная фильтрация

Контентная фильтрация основана на анализе характеристик объектов и профиля пользователя. Система сопоставляет признаки ранее понравившихся пользователю объектов (жанры, авторы, ключевые слова, категории) с признаками доступных объектов. Например, если пользователь часто слушает джазовые композиции, система будет рекомендовать записи, отнесённые к этому жанру. Преимуществом подхода является способность рекомендовать новые объекты без накопленной истории оценок, однако он страдает от проблемы «узкого профиля» — отсутствия разнообразия в рекомендациях.

Коллаборативная фильтрация

Коллаборативная фильтрация использует агрегированные данные о поведении множества пользователей. Различают два основных подхода:

  • Пользователь-пользователь (user-based): поиск пользователей со схожими предпочтениями и рекомендация объектов, которые понравились этим «соседям».
  • Объект-объект (item-based): поиск схожих объектов на основе того, как их оценивали пользователи. Этот метод применяется в Amazon и многих других платформах благодаря лучшей масштабируемости.

Гибридные системы

Гибридные рекомендательные системы комбинируют контентную и коллаборативную фильтрацию для компенсации недостатков каждого из подходов. Распространённые стратегии включают последовательное применение методов, взвешенное суммирование результатов и построение единой модели, объединяющей оба типа данных.

Архитектура и алгоритмы

Современные рекомендательные системы строятся на основе методов машинного обучения. К числу наиболее распространённых алгоритмов относятся:

  • Матричная факторизация — разложение матрицы оценок «пользователь-объект» на произведение двух низкоранговых матриц скрытых факторов. Метод получил известность благодаря конкурсу Netflix Prize.
  • Метод опорных векторов — используется для задач ранжирования кандидатов.
  • Градиентный бустинг (например, XGBoost, CatBoost) — применяется для построения моделей на основе множества признаков.
  • Глубокие нейронные сети — включая автоэнкодеры, рекуррентные сети и трансформеры, позволяют учитывать последовательности действий пользователя и контекстную информацию.

Типовая архитектура промышленной рекомендательной системы включает два этапа: этап кандидатов (candidate generation), на котором из всего каталога отбирается несколько тысяч потенциально релевантных объектов, и этап ранжирования (ranking), на котором кандидаты упорядочиваются по прогнозируемой вероятности взаимодействия с использованием более сложных моделей.

Метрики качества

Для оценки качества рекомендательных систем используются различные метрики. Офлайн-метрики вычисляются на исторических данных и включают:

  • RMSE и MAE — среднеквадратичная ошибка и средняя абсолютная ошибка прогноза оценок.
  • Precision@k и Recall@k — точность и полнота рекомендаций в топ-k.
  • NDCG (Normalized Discounted Cumulative Gain) — метрика, учитывающая позицию релевантного объекта в списке рекомендаций.

Онлайн-метрики оцениваются в ходе A/B-тестирования и включают показатели вовлечённости: кликабельность (CTR), время взаимодействия, конверсию в покупку и удержание пользователей.

Применение

Рекомендательные системы используются в следующих областях:

  • Электронная коммерция — предложение товаров на основе просмотров, покупок и корзины (Ozon, Wildberries, Amazon).
  • Стриминговые сервисы — рекомендация фильмов, сериалов и музыки («Кинопоиск», «Яндекс Музыка», Netflix, Spotify).
  • Социальные сети и медиа — персонализация ленты новостей и подбор контента (VK, «Дзен», TikTok).
  • Образовательные платформы — подбор курсов и учебных материалов (Coursera, Stepik).
  • Финансовые сервисы — рекомендация банковских продуктов и инвестиционных инструментов.

Проблемы и ограничения

Среди ключевых проблем рекомендательных систем выделяют:

  • Холодный старт — невозможность дать качественные рекомендации новым пользователям или новым объектам без накопленных данных.
  • Пузырь фильтров — чрезмерная персонализация приводит к сужению информационного поля пользователя и снижению разнообразия потребляемого контента.
  • Проблема длинного хвоста — алгоритмы склонны рекомендовать популярные объекты, игнорируя нишевый контент.
  • Прозрачность — сложность объяснения пользователю, почему ему предложен конкретный объект, особенно при использовании глубоких нейросетей.
  • Уязвимость к манипуляциям — возможность накрутки оценок для искусственного продвижения объектов.

Правовое регулирование в России

В Российской Федерации деятельность рекомендательных систем регулируется Федеральным законом от 27 июля 2006 года № 149-ФЗ «Об информации, информационных технологиях и о защите информации», а также Федеральным законом от 30 декабря 2020 года № 530-ФЗ, который внёс изменения в части регулирования «рекомендательных технологий». С 1 октября 2023 года вступили в силу требования, обязывающие владельцев сайтов и приложений, использующих рекомендательные алгоритмы, информировать пользователей о применении таких технологий и обеспечивать возможность отказа от персонализации. Операторы обязаны также не допускать использования рекомендательных технологий для распространения противоправной информации.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →