Открыть сервис

Semantic Scholar — поисковая система научных публикаций

Semantic Scholar — это бесплатная академическая поисковая система, разработанная Институтом искусственного интеллекта Аллена (AI2) и запущенная в 2015 году. Сервис использует методы обработки естественного языка и машинного обучения для поиска, анализа и ранжирования научных публикаций, преимущественно в области компьютерных наук, биомедицины и смежных дисциплин. В отличие от традиционных академических баз данных, Semantic Scholar не только индексирует тексты, но и извлекает из них структурированные данные: цитаты, ключевые выводы, экспериментальные методы и связи между работами.

История и развитие

Проект был анонсирован в ноябре 2015 года как инициатива Института искусственного интеллекта Аллена — некоммерческой исследовательской организации, основанной соучредителем Microsoft Полом Алленом в 2014 году. Первоначальная версия охватывала около 3 миллионов статей по компьютерным наукам. В 2017 году база данных была расширена на биомедицинскую литературу, что увеличило объём индексируемых материалов до 10 миллионов документов.

К 2024 году Semantic Scholar индексировал более 200 миллионов научных статей, включая материалы из крупнейших издательств (Elsevier, Springer Nature, IEEE) и открытых репозиториев (arXiv, PubMed Central). Развитие сервиса финансируется за счёт грантов и пожертвований; в 2020 году AI2 получил грант в размере 2,5 миллиона долларов от Национального научного фонда США на совершенствование алгоритмов семантического анализа.

Технология и принципы работы

Семантический анализ текста

Ядро системы составляет технология Semantic Reader, которая использует модели глубокого обучения (архитектуры на основе трансформеров, включая BERT и SciBERT) для автоматического извлечения смысловых элементов из научных текстов. Система распознаёт:

  • ключевые утверждения и гипотезы;
  • описание методологии и экспериментальных установок;
  • статистически значимые результаты;
  • ограничения исследования.

Извлечённые данные формируют «семантический граф», связывающий статьи по общим концепциям, методам и цитируемым источникам.

Алгоритмы ранжирования

В отличие от классических поисковиков, использующих полнотекстовый поиск, Semantic Scholar применяет гибридный подход. Поисковая выдача формируется на основе:

  1. текстового совпадения запроса с содержанием статьи;
  2. семантической близости (векторные представления текстов);
  3. наукометрических показателей (количество цитирований, влияние автора);
  4. релевантности контекста цитирования.

Для оценки влиятельности публикаций используется показатель TLDR (Too Long; Didn't Read) — автоматически сгенерированное краткое резюме статьи в 1–2 предложения, а также метрика Citation Velocity (скорость накопления цитирований).

Функциональные возможности

Поиск и фильтрация

Пользователям доступен расширенный поиск с фильтрами по дате публикации, типу документа (статья, обзор, конференционные материалы), полю исследования, автору и журналу. Поддерживается поиск по фразам, булевым операторам и DOI. Результаты можно сортировать по дате, количеству цитирований или релевантности.

Профили авторов

Система автоматически формирует профили исследователей на основе анализа публикационной активности. Профиль включает список работ, показатели цитируемости (h-индекс, i10-индекс), аффилиацию и соавторов. Раздел «Research Feed» позволяет подписываться на обновления по конкретным темам или авторам.

Инструменты для разработчиков

Semantic Scholar предоставляет открытый API (S2 API) с ограничением 100 запросов в секунду для зарегистрированных пользователей. Через API доступны методы поиска, получения метаданных статей, цитатных графов и TLDR-резюме. На базе этого API созданы сторонние приложения, включая браузерные расширения для быстрой проверки цитирований.

Интеграция с другими сервисами

Система взаимодействует с ORCID, DOI-регистратурой Crossref и открытым архивом arXiv. В 2023 году запущена интеграция с платформой PubMed, позволяющая переходить к полным текстам статей из базы Национальной медицинской библиотеки США.

Критика и ограничения

Основные замечания исследователей касаются следующих аспектов:

  • Охват литературы. Несмотря на заявленные 200 миллионов записей, система индексирует преимущественно англоязычные источники. Доля русскоязычных и китайских научных журналов остаётся незначительной, что ограничивает применение сервиса для анализа региональных научных школ.
  • Качество метаданных. Автоматическое извлечение данных иногда приводит к ошибкам: неправильному определению авторов, дублированию записей, неточным датам.
  • Прозрачность алгоритмов. Точные параметры ранжирования не раскрываются, что затрудняет воспроизводимость результатов поиска.
  • Предвзятость обучения. Модели, обученные на подмножестве статей, могут систематически недооценивать работы из мало представленных в обучающей выборке областей.

Сравнение с аналогами

ПараметрSemantic ScholarGoogle ScholarScopusWeb of Science
СтоимостьБесплатныйБесплатныйПодпискаПодписка
Охват200+ млн~400 млн~90 млн~80 млн
Семантический анализДаНетЧастичноНет
TLDR-резюмеДаНетНетНет
Открытый APIДаОграниченныйДаДа

Ключевое отличие Semantic Scholar от Google Scholar — наличие структурированных данных о содержании статей и развитых инструментов семантического поиска, тогда как Google Scholar превосходит его по общему охвату и полноте индексации.

Практическое применение

Сервис активно используется научными сотрудниками для первичного поиска литературы, отслеживания новых публикаций по узкой тематике и оценки влиятельности конкретных работ. Библиотекари и наукометристы применяют S2 API для построения карт научных направлений и выявления скрытых связей между исследовательскими группами. В 2021 году система была интегрирована в инструменты компании Elicit, автоматизирующей подготовку обзоров литературы.

Согласно данным AI2, ежемесячная аудитория Semantic Scholar превышает 10 миллионов уникальных пользователей, а суммарное число обращений к API достигает 500 миллионов запросов в год.

Источники

  1. Ammar W., Peters M., Bhagavatula C. et al. Construction of the Literature Graph in Semantic Scholar // Proceedings of NAACL-HLT. — 2018.
  2. Kinney R., Anastasiades C., Authur R. et al. The Semantic Scholar Open Data Platform // arXiv preprint. — 2023.
  3. Официальная документация Semantic Scholar API (semanticscholar.org).
  4. Отчёты Института искусственного интеллекта Аллена о развитии платформы (2015–2024).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →