Открыть сервис

Алгоритмическое ранжирование

Алгоритмическое ранжирование — это процесс упорядочивания набора данных (документов, веб-страниц, товаров, результатов поиска) по степени их релевантности, важности или полезности для конкретного пользователя или запроса, выполняемый по заданным правилам (алгоритму). Является ключевым механизмом работы поисковых систем, рекомендательных сервисов, социальных сетей и платформ электронной коммерции.

История

Ранние методы

Первые системы информационного поиска, такие как SMART (США, 1960-е) и STAIRS (IBM, 1970-е), использовали простые статистические модели. Основой служила векторная модель, где каждый документ и запрос представлялись в виде векторов термов (слов). Ранжирование проводилось по косинусной мере сходства между векторами. В 1970-х годах Карен Спарк Джонс предложила концепцию TF-IDF (Term Frequency — Inverse Document Frequency), которая оценивала важность слова в документе относительно всей коллекции.

Эпоха поисковых систем

С развитием интернета и ростом количества веб-страниц возникла необходимость в ранжировании, устойчивом к спаму и манипуляциям. В 1998 году основатели Google Ларри Пейдж и Сергей Брин представили алгоритм PageRank, который оценивал важность страницы не по её содержанию, а по количеству и качеству внешних ссылок на неё. Ссылка от авторитетного сайта передавала больший «вес». Это стало революцией: ранжирование перестало зависеть только от текста.

В 1999 году был запущен алгоритм Hyperlink-Induced Topic Search (HITS) (разработчик — Джон Клейнберг), который делил страницы на «авторитеты» (содержащие ценную информацию) и «хабы» (содержащие ссылки на авторитеты). Однако на практике наиболее широкое распространение получил именно PageRank в сочетании с TF-IDF.

Современный этап

С 2010-х годов доминирующим подходом стало машинное обучение. Поисковые системы (Google, Яндекс, Bing) перешли на использование ранжирующих моделей на основе нейронных сетей. В 2015 году Google представил RankBrain — систему на основе искусственного интеллекта, которая обрабатывала запросы, не встречавшиеся ранее, и обучалась на пользовательском поведении. В 2019 году был внедрён BERT (Bidirectional Encoder Representations from Transformers), который позволил понимать контекст слов в запросе (например, различие между «книга для детей» и «книга о детях»). В 2021 году Google анонсировал MUM (Multitask Unified Model) — мультимодальную модель, способную анализировать текст, изображения и видео одновременно.

Классификация алгоритмов ранжирования

По способу вычисления релевантности

  1. Статистические (классические) методы:
  • TF-IDF: основаны на частоте термина в документе и обратной частоте во всей коллекции.
  • BM25 (Okapi BM25): вероятностная модель, улучшающая TF-IDF за счёт учёта длины документа и насыщения частоты.
  • Векторная модель: сравнение векторов запроса и документа.
  1. Методы на основе машинного обучения (Learning to Rank, LTR):
  • Pointwise: для каждого документа предсказывается абсолютная оценка релевантности (например, регрессия).
  • Pairwise: сравниваются пары документов, и алгоритм учится определять, какой из двух более релевантен (например, RankNet, LambdaRank).
  • Listwise: оптимизируется порядок всего списка документов сразу (например, ListNet, SoftRank). Современные системы (например, в Яндексе — «Матрикснет») используют этот подход.
  1. Нейросетевые методы:
  • DSSM (Deep Structured Semantic Model): отображает запросы и документы в общее семантическое пространство.
  • BERT, MUM: трансформерные модели, понимающие контекст и синонимию.
  • Графовые нейронные сети (GNN): учитывают связи между документами (например, ссылки, цитирования).

По учёту факторов

  1. Текстовые: учитывают содержание страницы (заголовки, мета-теги, основной текст, плотность ключевых слов).
  2. Ссылочные: анализируют внешние и внутренние ссылки (PageRank, TrustRank, тематический индекс цитирования).
  3. Поведенческие: учитывают действия пользователей (клики, время на сайте, глубина просмотра, показатель отказов). В Яндексе — это «текущие поведенческие факторы».
  4. Коммерческие: для товарных запросов — цена, наличие, отзывы, рейтинг продавца.
  5. Региональные и персональные: местоположение пользователя, история его запросов, предпочтения.

Устройство и принцип работы

Современная система алгоритмического ранжирования в поисковой системе обычно состоит из нескольких этапов:

  1. Индексация: сбор и анализ веб-страниц, извлечение текста, ссылок, метаданных.
  2. Обработка запроса: нормализация, удаление стоп-слов, определение интента (намерения пользователя: информационный, навигационный, коммерческий).
  3. Первичный отбор (retrieval): быстрый поиск по индексу, отбор кандидатов (обычно несколько тысяч документов) с помощью упрощённых моделей (например, BM25).
  4. Ранжирование (re-ranking): применение сложных моделей (нейронные сети, LTR) для точного упорядочивания отобранных кандидатов. На этом этапе учитываются сотни и тысячи факторов.
  5. Постобработка: применение правил (например, фильтрация дубликатов, учёт авторских прав, демонстрация специальных блоков — карточек, видео).

Применение

Поисковые системы

Является основным применением. Google, Яндекс, Bing, Baidu используют алгоритмическое ранжирование для выдачи результатов на запросы пользователей. В России Яндекс активно использует собственные технологии, включая «Королёв» (нейросеть для понимания смысла запросов) и «Палех» (ранжирование с учётом региональных особенностей).

Рекомендательные системы

  • Видеохостинги (YouTube, RuTube): алгоритмы ранжируют видео по вероятности просмотра, времени удержания, свежести.
  • Музыкальные сервисы (Яндекс.Музыка, Spotify): учитывают жанр, историю прослушиваний, настроение.
  • Социальные сети (ВКонтакте, Одноклассники): новостная лента ранжируется по релевантности для пользователя (алгоритм «Прометей» во ВКонтакте).

Электронная коммерция

  • Маркетплейсы (Ozon, Wildberries, Яндекс.Маркет): ранжирование товаров по сочетанию релевантности запросу, цены, рейтинга, наличия, скорости доставки.
  • Поиск товаров: учитывает характеристики (цвет, размер, бренд).

Научная и деловая сфера

  • Поиск научных статей (Google Scholar, eLibrary): ранжирование по цитируемости, дате публикации, авторитетности журнала.
  • Поиск вакансий (HeadHunter, SuperJob): учитывает соответствие навыков, зарплатные ожидания, активность соискателя.

Критика и ограничения

  1. Пузырь фильтров (filter bubble): персональное ранжирование может изолировать пользователя от информации, не совпадающей с его взглядами. Термин введён Эли Паризером в 2011 году.
  2. Манипуляция и SEO-спам: владельцы сайтов пытаются искусственно повысить позиции, используя накрутку ссылок, ключевые слова-паразиты, дорвеи. Поисковые системы постоянно обновляют алгоритмы для борьбы с этим (например, алгоритмы Google Panda и Penguin).
  3. Необъективность: алгоритмы могут наследовать предвзятость из обучающих данных. Например, при поиске «врач» чаще показываются мужчины, а «медсестра» — женщины.
  4. Проблема свежести: старые, но авторитетные страницы могут доминировать, вытесняя новые, более актуальные материалы. Для решения используются алгоритмы, учитывающие время публикации (например, Google Caffeine).
  5. Непрозрачность: точные формулы и веса факторов держатся в секрете, что затрудняет оптимизацию и порождает спекуляции.

Интересные факты

  • Первый в истории алгоритм ранжирования для интернета — RankDex (Робин Ли, 1996 год) — использовал анализ ссылок, аналогичный PageRank, но был запатентован позже.
  • Алгоритм PageRank назван в честь Ларри Пейджа, а не в честь «веб-страницы» (page).
  • В 2022 году в России вступил в силу закон о «значимых сайтах», который обязывает поисковые системы (Яндекс) использовать единую государственную информационную систему (ЕГИС) для ранжирования, что может влиять на порядок выдачи в соответствии с законодательством.
  • В Яндексе используется собственная технология ранжирования «Спектр», которая для сложных запросов может показывать несколько блоков результатов (например, товары и статьи одновременно).

Источники

  1. Брин С., Пейдж Л. «The Anatomy of a Large-Scale Hypertextual Web Search Engine» (1998).
  2. Клейнберг Дж. «Authoritative sources in a hyperlinked environment» (1999).
  3. Паризер Э. «The Filter Bubble: What the Internet Is Hiding from You» (2011).
  4. Документация Google по алгоритмам ранжирования (Google Search Central).
  5. Документация Яндекса по технологии ранжирования (Яндекс.Вебмастер).
  6. Федеральный закон от 27.07.2006 № 149-ФЗ «Об информации, информационных технологиях и о защите информации» (с изменениями).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →