Открыть сервис

FAIR-принципы

FAIR-принципы — это набор руководящих принципов, направленных на обеспечение управляемости, доступности, совместимости и повторного использования цифровых объектов, в первую очередь научных данных и исследовательских материалов. Аббревиатура FAIR расшифровывается как Findable (находимость), Accessible (доступность), Interoperable (совместимость) и Reusable (повторное использование). Принципы были впервые сформулированы в 2016 году группой исследователей и издателей, а их основная цель — повышение эффективности научной работы за счёт устранения барьеров, связанных с поиском, получением и интеграцией данных из разных источников.

История

Концепция FAIR-принципов возникла в ответ на растущий объём цифровых данных, генерируемых в науке, и на проблемы, связанные с их хранением, поиском и повторным использованием. В 2014 году на семинаре в Лейдене (Нидерланды) группа учёных, библиотекарей и представителей издательств обсудила необходимость создания универсальных стандартов. Результатом этой работы стала публикация в 2016 году в журнале Scientific Data статьи «The FAIR Guiding Principles for scientific data management and stewardship», авторами которой выступили Марк Уилкинсон, Мишель Дюмонтье и другие. В статье были предложены четыре ключевых принципа, каждый из которых детализирован в виде конкретных требований.

С момента публикации FAIR-принципы получили широкое признание в научном сообществе. Они были поддержаны такими организациями, как Европейская комиссия, Национальные институты здравоохранения США (NIH), а также рядом международных научных фондов и издательств. В 2018 году Европейская комиссия включила FAIR-принципы в свою программу Horizon 2020, требуя от участников проектов обеспечивать FAIR-совместимость данных. В России FAIR-принципы также начали внедряться в рамках национальных проектов по цифровизации науки, в частности, в работе Российского научного фонда и Центрального экономико-математического института РАН.

Основные принципы

FAIR-принципы делятся на четыре группы, каждая из которых описывает конкретные аспекты управления данными.

Findable (находимость)

Для того чтобы данные были находимыми, они должны быть снабжены уникальными и постоянными идентификаторами (например, DOI, Handle, PURL). Эти идентификаторы должны быть связаны с метаданными, которые описывают данные. Метаданные должны быть доступны в поисковых системах и реестрах, а также содержать информацию о том, как получить доступ к данным. Ключевое требование — метаданные должны быть индексируемыми, то есть содержать ключевые слова, позволяющие их найти.

Accessible (доступность)

Доступность означает, что данные и метаданные могут быть получены по их идентификаторам с использованием стандартизированных протоколов (например, HTTP, FTP). При этом не обязательно, чтобы данные были открытыми — доступ может быть ограничен (например, по паролю или по лицензии). Однако протокол доступа должен быть чётко определён, а в случае невозможности доступа (например, из-за конфиденциальности) должна быть указана причина. Важно, чтобы метаданные оставались доступными даже в том случае, если сами данные недоступны.

Interoperable (совместимость)

Совместимость предполагает, что данные и метаданные должны быть представлены в форматах, которые могут быть обработаны другими системами. Для этого используются стандартные форматы данных (например, CSV, JSON, XML), а также онтологии и контролируемые словари. Метаданные должны включать ссылки на эти стандарты и онтологии, чтобы другие исследователи могли понять структуру и семантику данных. Кроме того, данные должны быть пригодны для интеграции с другими наборами данных.

Reusable (повторное использование)

Повторное использование требует, чтобы данные были снабжены чёткой лицензией, определяющей условия их использования. Метаданные должны содержать информацию о происхождении данных, методах их сбора и обработки, а также о возможных ограничениях. Важно, чтобы данные были представлены в форматах, которые не устаревают, и чтобы они были документированы настолько подробно, чтобы другие исследователи могли их воспроизвести или использовать в новых целях.

Реализация и оценка

Реализация FAIR-принципов требует внедрения инфраструктурных решений, таких как репозитории данных, системы управления метаданными и инструменты для автоматической проверки. Для оценки FAIR-совместимости разработаны специальные метрики и инструменты, например, FAIRshake, FAIRmetrics и FAIRsFAIR. Эти инструменты анализируют, насколько данные соответствуют каждому из принципов, и выдают количественные оценки.

На практике FAIR-принципы могут быть реализованы на разных уровнях. Например, в биологии и медицине широко используются такие репозитории, как GenBank (для генетических данных) и PubMed Central (для научных статей). В России одним из примеров является Национальный центр биотехнологической информации (НЦБИ), который поддерживает FAIR-совместимые базы данных. В области гуманитарных наук FAIR-принципы применяются в проектах по цифровым архивам, например, в проекте «Электронная библиотека «Научное наследие России»».

Критика и ограничения

Несмотря на широкое признание, FAIR-принципы подвергаются критике. Основные замечания касаются их абстрактности и сложности реализации. Многие исследователи, особенно в гуманитарных областях, сталкиваются с трудностями при внедрении стандартов, требующих больших затрат времени и ресурсов. Кроме того, FAIR-принципы не решают проблему качества данных — они лишь обеспечивают их управляемость, но не гарантируют достоверность или релевантность. Также отмечается, что принципы ориентированы в первую очередь на цифровые данные, и их применение к аналоговым материалам (например, бумажным архивам) ограничено.

Ещё одной проблемой является отсутствие единого подхода к оценке FAIR-совместимости. Разные инструменты могут давать разные результаты, что затрудняет сравнение данных из разных источников. Некоторые исследователи также указывают на то, что FAIR-принципы могут способствовать коммерциализации научных данных, если они будут реализованы через платные сервисы.

Примеры применения

FAIR-принципы находят применение в различных областях науки. В биоинформатике они используются для управления данными о геномах, протеомах и метаболомах. Например, база данных UniProt (UniProt Knowledgebase) соответствует FAIR-принципам, предоставляя уникальные идентификаторы, стандартные форматы и лицензии. В климатологии данные спутниковых наблюдений и моделей хранятся в FAIR-совместимых репозиториях, таких как Copernicus Climate Data Store. В социальных науках FAIR-принципы применяются для управления данными опросов и переписей, например, в проекте European Social Survey.

В России FAIR-принципы внедряются в рамках программы «Цифровая экономика РФ». Например, в 2021 году Институт проблем передачи информации РАН запустил проект по созданию FAIR-совместимого репозитория для данных о российской науке. Также FAIR-принципы используются в работе Российского индекса научного цитирования (РИНЦ), который постепенно переходит на стандарты, позволяющие автоматически обмениваться данными с международными системами.

Будущее развитие

Ожидается, что FAIR-принципы будут эволюционировать в сторону большей автоматизации и интеграции с искусственным интеллектом. Разрабатываются инструменты для автоматического присвоения идентификаторов и генерации метаданных. Также ведётся работа по созданию «FAIR-данных по умолчанию» — то есть таких форматов, которые автоматически соответствуют принципам. В перспективе FAIR-принципы могут стать основой для создания единого глобального пространства научных данных, что ускорит развитие науки и технологий.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →