Рекомендательные системы и их применение
Рекомендательная система (англ. recommender system) — это класс алгоритмов и программных средств, предназначенных для прогнозирования предпочтений пользователя и предложения релевантных объектов (товаров, услуг, контента) на основе анализа исторических данных, поведенческих паттернов и контекстной информации. Рекомендательные системы являются подклассом систем фильтрации информации и широко применяются в электронной коммерции, стриминговых сервисах, социальных сетях и других цифровых платформах.
История развития
Первые концепции автоматической фильтрации информации появились в 1970-х годах в рамках исследований в области информационного поиска. Одной из первых систем, использующих принцип коллективной фильтрации, стала система Tapestry, разработанная в исследовательском центре Xerox PARC в 1992 году. Она позволяла сотрудникам компании помечать документы как релевантные или нерелевантные, после чего система использовала эти оценки для фильтрации входящих сообщений.
В 1994 году группа исследователей Массачусетского технологического института представила систему GroupLens, которая применяла алгоритмы коллаборативной фильтрации для рекомендации новостных статей в сети Usenet. Эта работа заложила теоретические основы современных рекомендательных алгоритмов. В 1997 году компания Amazon запатентовала технологию «покупки, связанные с покупками» (item-to-item collaborative filtering), что стало коммерческим прорывом в области персонализации.
С 2000-х годов рекомендательные системы стали неотъемлемой частью крупнейших интернет-платформ — Netflix, YouTube, Spotify, а также российских сервисов «Яндекс», «Кинопоиск» и VK. В 2006 году компания Netflix объявила конкурс Netflix Prize с призовым фондом 1 миллион долларов за улучшение точности рекомендаций на 10 %, что стимулировало значительный прогресс в разработке алгоритмов матричной факторизации.
Классификация методов
Контентная фильтрация
Контентная фильтрация основана на анализе характеристик объектов и профиля пользователя. Система сопоставляет признаки ранее понравившихся пользователю объектов (жанры, авторы, ключевые слова, категории) с признаками доступных объектов. Например, если пользователь часто слушает джазовые композиции, система будет рекомендовать записи, отнесённые к этому жанру. Преимуществом подхода является способность рекомендовать новые объекты без накопленной истории оценок, однако он страдает от проблемы «узкого профиля» — отсутствия разнообразия в рекомендациях.
Коллаборативная фильтрация
Коллаборативная фильтрация использует агрегированные данные о поведении множества пользователей. Различают два основных подхода:
- Пользователь-пользователь (user-based): поиск пользователей со схожими предпочтениями и рекомендация объектов, которые понравились этим «соседям».
- Объект-объект (item-based): поиск схожих объектов на основе того, как их оценивали пользователи. Этот метод применяется в Amazon и многих других платформах благодаря лучшей масштабируемости.
Гибридные системы
Гибридные рекомендательные системы комбинируют контентную и коллаборативную фильтрацию для компенсации недостатков каждого из подходов. Распространённые стратегии включают последовательное применение методов, взвешенное суммирование результатов и построение единой модели, объединяющей оба типа данных.
Архитектура и алгоритмы
Современные рекомендательные системы строятся на основе методов машинного обучения. К числу наиболее распространённых алгоритмов относятся:
- Матричная факторизация — разложение матрицы оценок «пользователь-объект» на произведение двух низкоранговых матриц скрытых факторов. Метод получил известность благодаря конкурсу Netflix Prize.
- Метод опорных векторов — используется для задач ранжирования кандидатов.
- Градиентный бустинг (например, XGBoost, CatBoost) — применяется для построения моделей на основе множества признаков.
- Глубокие нейронные сети — включая автоэнкодеры, рекуррентные сети и трансформеры, позволяют учитывать последовательности действий пользователя и контекстную информацию.
Типовая архитектура промышленной рекомендательной системы включает два этапа: этап кандидатов (candidate generation), на котором из всего каталога отбирается несколько тысяч потенциально релевантных объектов, и этап ранжирования (ranking), на котором кандидаты упорядочиваются по прогнозируемой вероятности взаимодействия с использованием более сложных моделей.
Метрики качества
Для оценки качества рекомендательных систем используются различные метрики. Офлайн-метрики вычисляются на исторических данных и включают:
- RMSE и MAE — среднеквадратичная ошибка и средняя абсолютная ошибка прогноза оценок.
- Precision@k и Recall@k — точность и полнота рекомендаций в топ-k.
- NDCG (Normalized Discounted Cumulative Gain) — метрика, учитывающая позицию релевантного объекта в списке рекомендаций.
Онлайн-метрики оцениваются в ходе A/B-тестирования и включают показатели вовлечённости: кликабельность (CTR), время взаимодействия, конверсию в покупку и удержание пользователей.
Применение
Рекомендательные системы используются в следующих областях:
- Электронная коммерция — предложение товаров на основе просмотров, покупок и корзины (Ozon, Wildberries, Amazon).
- Стриминговые сервисы — рекомендация фильмов, сериалов и музыки («Кинопоиск», «Яндекс Музыка», Netflix, Spotify).
- Социальные сети и медиа — персонализация ленты новостей и подбор контента (VK, «Дзен», TikTok).
- Образовательные платформы — подбор курсов и учебных материалов (Coursera, Stepik).
- Финансовые сервисы — рекомендация банковских продуктов и инвестиционных инструментов.
Проблемы и ограничения
Среди ключевых проблем рекомендательных систем выделяют:
- Холодный старт — невозможность дать качественные рекомендации новым пользователям или новым объектам без накопленных данных.
- Пузырь фильтров — чрезмерная персонализация приводит к сужению информационного поля пользователя и снижению разнообразия потребляемого контента.
- Проблема длинного хвоста — алгоритмы склонны рекомендовать популярные объекты, игнорируя нишевый контент.
- Прозрачность — сложность объяснения пользователю, почему ему предложен конкретный объект, особенно при использовании глубоких нейросетей.
- Уязвимость к манипуляциям — возможность накрутки оценок для искусственного продвижения объектов.
Правовое регулирование в России
В Российской Федерации деятельность рекомендательных систем регулируется Федеральным законом от 27 июля 2006 года № 149-ФЗ «Об информации, информационных технологиях и о защите информации», а также Федеральным законом от 30 декабря 2020 года № 530-ФЗ, который внёс изменения в части регулирования «рекомендательных технологий». С 1 октября 2023 года вступили в силу требования, обязывающие владельцев сайтов и приложений, использующих рекомендательные алгоритмы, информировать пользователей о применении таких технологий и обеспечивать возможность отказа от персонализации. Операторы обязаны также не допускать использования рекомендательных технологий для распространения противоправной информации.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


