Открыть сервис

Поисковая машина

Поисковая машинапрограммно-аппаратный комплекс, предназначенный для поиска, сбора, обработки, хранения и выдачи информации по запросу пользователя. В узком смысле под поисковой машиной понимают интернет-поисковик — систему, которая индексирует веб-страницы и предоставляет ссылки на них по ключевым словам. В широком смысле к поисковым машинам относят также системы поиска в базах данных, электронных библиотеках, файловых хранилищах и корпоративных сетях.

История

Первые автоматизированные системы поиска информации появились в середине XX века. В 1945 году американский инженер Вэнивар Буш описал концепцию гипертекстового устройства «Мемекс», позволявшего связывать документы ассоциативными ссылками. В 1960-х годах получили развитие информационно-поисковые системы (ИПС), работавшие с библиографическими описаниями и патентными фондами.

В 1990 году студент Университета Макгилла Алан Эмтаж создал программу Archieпервый инструмент поиска файлов на FTP-серверах. В 1991 году появился Gopher, а в 1993-м — Wandex и Aliweb, индексировавшие ранний веб. В 1994 году начали работу WebCrawler, Lycos и Yahoo! (первоначально как каталог сайтов). В 1998 году была основана Google, предложившая ранжирование страниц по алгоритму PageRank, учитывающему число и качество внешних ссылок.

В России первые поисковые системы появились в 1996–1997 годах: «Рамблер», «Апорт» и «Яндекс». «Яндекс» был создан в 1997 году как поисковый продукт компании CompTek, а в 2000 году выделился в самостоятельную компанию. Система «Рамблер» долгое время оставалась одним из крупнейших каталогов русскоязычного сегмента сети.

Устройство и принцип работы

Типовая интернет-поисковая машина включает несколько взаимосвязанных подсистем:

  • Краулер (поисковый робот) — программа, автоматически обходящая веб-страницы по ссылкам и загружающая их содержимое.
  • Индексатор — модуль, разбирающий документы на слова, нормализующий их (приведение к базовой форме, отбрасывание стоп-слов) и формирующий обратный индекс.
  • База данных (индекс)хранилище, где каждому слову сопоставлен список документов и позиций, в которых оно встречается.
  • Поисковый сервер — обрабатывает запрос пользователя, извлекает подходящие документы и ранжирует их.
  • Ранжирующий алгоритм — определяет порядок выдачи с учётом релевантности, авторитетности, свежести и поведенческих факторов.

Обратный индекс — ключевое понятие: вместо перебора всех документов система мгновенно находит те, где встречается нужное слово. Для ускорения работы применяются сжатие индекса, распределённые вычисления и кэширование.

Классификация

По области применения выделяют:

ТипНазначениеПримеры
Веб-поисковикиПоиск в интернетеGoogle, «Яндекс», Bing, Baidu
МетапоисковикиАгрегация результатов других системDuckDuckGo, MetaGer
Вертикальные поисковикиПоиск в узкой сфереGoogle Scholar, «Кинопоиск»
Корпоративные ИПСПоиск во внутренних документахСистемы класса Enterprise Search
ДесктопныеПоиск файлов на устройствеSpotlight, Windows Search

По способу формирования базы различают системы, работающие с собственным индексом, и метасистемы, транслирующие запрос чужим поисковикам.

Ранжирование и релевантность

Релевантность — мера соответствия найденного документа информационной потребности пользователя. Основные факторы ранжирования:

  • частота и расположение ключевых слов (заголовок, начало текста);
  • количество и авторитетность входящих ссылок;
  • возраст домена и регулярность обновлений;
  • поведенческие метрики — клики, время на странице, отказы;
  • географическая и языковая привязка запроса.

С конца 2010-х годов в ранжирование внедряются методы машинного обучения и нейросетевые модели, анализирующие смысл запроса, а не только отдельные слова. Это позволяет обрабатывать естественно-языковые формулировки и учитывать синонимию.

Применение и значение

Поисковые машины стали основным инструментом навигации в интернете. Они обеспечивают доступ к новостям, научным публикациям, товарам, картам, справочным данным. На базе поиска строятся сервисы: контекстная реклама, голосовые ассистенты, системы рекомендаций, вопросно-ответные системы.

В России крупнейшим поисковиком является «Яндекс», занимающий значительную долю рынка русскоязычного поиска; также работают Google и Mail.ru. Поисковые системы подчиняются законодательству о персональных данных и об информации: в РФ действуют требования о локализации данных пользователей и о фильтрации запрещённого контента через единый реестр.

Критика и ограничения

К основным проблемам поисковых машин относят:

  • Поисковый спам — искусственное завышение позиций сайтов;
  • Пузырь фильтров — персонализация выдачи, ограничивающая кругозор пользователя;
  • Приватность — сбор данных о запросах и поведении;
  • Неполнота индекса — часть веба (глубокий веб) остаётся недоступной роботам;
  • Монополизация — доминирование отдельных игроков на рынке.

Для снижения зависимости от одной системы применяются метапоисковики и поисковики с политикой отказа от отслеживания.

Перспективы

Развитие поисковых машин связано с генеративными моделями: вместо списка ссылок системы всё чаще формируют прямой ответ на вопрос, ссылаясь на источники. Растёт роль мультимодального поиска — по изображению, голосу, видео. Совершенствуются методы семантического анализа и обработки запросов на естественном языке.

Источники: материалы по истории вычислительной техники и информационного поиска; документация поисковых систем «Яндекс», Google; публикации по теории информационно-поисковых систем; обзоры рынка интернет-поиска.