UniProt
UniProt — это открытая, общедоступная база данных белковых последовательностей и функциональной информации о белках. Проект представляет собой централизованное хранилище, объединяющее данные из множества источников, и является одним из ключевых ресурсов в биоинформатике и молекулярной биологии. UniProt поддерживается консорциумом, в который входят Европейский институт биоинформатики (EBI), Институт биоинформатики Швейцарии (SIB) и Исследовательский центр по белковой информации (PIR) в США.
История
Проект UniProt был создан в 2002 году в результате слияния трёх крупных баз данных белков: Swiss-Prot, TrEMBL и PIR-PSD. Каждая из этих баз имела свою историю и специализацию.
- Swiss-Prot была основана в 1986 году Амосом Байрохом (Швейцарский институт биоинформатики) и начала вестись в сотрудничестве с EBI. Она отличалась высоким качеством аннотаций, которые вручную проверялись экспертами.
- TrEMBL (Translated EMBL Nucleotide Sequence Data Library) была создана в 1996 году как автоматически аннотируемое дополнение к Swiss-Prot. Она содержала переводы всех последовательностей, загруженных в базу данных нуклеотидных последовательностей EMBL-Bank, которые ещё не были включены в Swiss-Prot.
- PIR-PSD (Protein Information Resource — Protein Sequence Database) была одной из старейших баз данных белков, созданной в 1984 году Национальным биомедицинским исследовательским фондом (NBRF) в США.
Объединение этих ресурсов в единый консорциум позволило устранить дублирование, повысить качество данных и создать единую точку доступа для исследователей по всему миру. С тех пор UniProt постоянно развивается, добавляя новые типы данных и улучшая инструменты поиска.
Структура и основные компоненты
UniProt состоит из нескольких взаимосвязанных баз данных, каждая из которых выполняет свою функцию.
UniProtKB (UniProt Knowledgebase)
Это центральная база знаний, содержащая основную информацию о белках. Она делится на два раздела:
- UniProtKB/Swiss-Prot: Раздел с аннотациями, прошедшими экспертную проверку вручную. Каждая запись в Swiss-Prot содержит тщательно выверенную информацию о функции белка, его доменной структуре, посттрансляционных модификациях, клеточной локализации, взаимодействиях с другими молекулами, а также ссылки на литературные источники. Записи Swiss-Prot отличаются высокой достоверностью, но их количество ограничено (около 570 000 записей на начало 2024 года).
- UniProtKB/TrEMBL: Раздел с автоматически аннотированными записями, которые не прошли ручную проверку. Эти записи генерируются на основе компьютерного анализа и содержат предсказанную информацию. TrEMBL значительно больше Swiss-Prot (более 250 миллионов записей) и охватывает практически все известные белковые последовательности, включая те, которые были получены в результате крупномасштабных геномных проектов.
UniRef (UniProt Reference Clusters)
UniRef — это база данных кластеров последовательностей, созданная для уменьшения избыточности и ускорения поиска. Белковые последовательности из UniProtKB и других источников группируются в кластеры на основе заданного уровня идентичности (например, 100%, 90% или 50%). Для каждого кластера выбирается репрезентативная последовательность, что позволяет проводить поиск по меньшему, но репрезентативному набору данных.
UniParc (UniProt Archive)
UniParc — это архив, который хранит все версии всех белковых последовательностей, когда-либо появлявшихся в публичных базах данных. Он служит для отслеживания изменений в последовательностях и позволяет проследить историю каждой записи. В отличие от UniProtKB, UniParc не содержит аннотаций, а только сами последовательности и их идентификаторы.
Функциональные возможности
UniProt предоставляет широкий спектр инструментов для анализа и поиска данных.
Поиск и навигация
Пользовательский интерфейс позволяет выполнять поиск по различным критериям: названию белка, названию гена, таксономии, ключевым словам, идентификаторам из других баз данных (например, RefSeq, PDB) и по тексту аннотаций. Результаты поиска можно фильтровать и сортировать.
Инструменты анализа последовательностей
- BLAST (Basic Local Alignment Search Tool): Позволяет находить сходные последовательности в базе данных UniProt по заданной последовательности пользователя.
- Align: Инструмент для множественного выравнивания последовательностей.
- Peptide Search: Позволяет находить белки, содержащие заданную пептидную последовательность.
Интеграция с другими ресурсами
UniProt тесно интегрирован с другими биоинформатическими базами данных, такими как:
- PDB (Protein Data Bank) — для трёхмерных структур белков.
- Ensembl и NCBI — для геномных данных.
- Gene Ontology (GO) — для стандартизированной терминологии функций, процессов и компонентов клетки.
- Reactome и KEGG — для путей метаболизма и сигнальных каскадов.
- PubMed — для ссылок на научные статьи.
Применение
UniProt является незаменимым инструментом для широкого круга исследователей в области биологии, медицины и биотехнологии.
- Фундаментальные исследования: Изучение эволюции белков, их структуры и функции. Сравнительный анализ последовательностей из разных организмов.
- Медицина: Поиск генетических вариантов, связанных с заболеваниями. Идентификация белков-мишеней для лекарственных препаратов. Анализ мутаций в белках, вызывающих наследственные болезни.
- Биотехнология: Разработка ферментов для промышленного использования. Инженерия белков с заданными свойствами.
- Протеомика: Идентификация и количественный анализ белков в биологических образцах (например, с помощью масс-спектрометрии). UniProt служит эталонной базой для интерпретации результатов протеомных экспериментов.
Критика и ограничения
Несмотря на свою ценность, UniProt имеет некоторые ограничения.
- Неполнота аннотаций: Для многих белков, особенно из малоизученных организмов, информация в Swiss-Prot отсутствует, а в TrEMBL она может быть неточной или предсказательной.
- Задержка обновлений: Хотя база данных обновляется регулярно, между появлением новой информации в научной литературе и её включением в Swiss-Prot может пройти значительное время.
- Сложность для новичков: Интерфейс и инструменты UniProt могут быть сложными для пользователей, не имеющих опыта в биоинформатике.
- Зависимость от других баз данных: Качество аннотаций в TrEMBL напрямую зависит от качества данных, подаваемых в нуклеотидные базы данных (например, GenBank). Ошибки в первичных данных могут распространяться на UniProt.
Интересные факты
- Название «UniProt» происходит от английских слов «Universal Protein Resource» (Универсальный белковый ресурс).
- Каждая запись в UniProtKB имеет уникальный идентификатор (например, P04637 для белка p53 человека), который широко используется в научной литературе.
- Проект UniProt является одним из крупнейших и наиболее активно используемых ресурсов в биоинформатике, обрабатывая миллионы запросов от исследователей по всему миру ежедневно.
- Консорциум UniProt активно участвует в разработке стандартов для представления биологических данных, таких как FAIR (Findable, Accessible, Interoperable, Reusable) принципы.
Источники
- UniProt Consortium. (2023). UniProt: the Universal Protein Knowledgebase in 2023. Nucleic Acids Research, 51(D1), D523-D531.
- Bairoch, A., & Apweiler, R. (2000). The SWISS-PROT protein sequence database and its supplement TrEMBL in 2000. Nucleic Acids Research, 28(1), 45-48.
- Wu, C. H., et al. (2002). The Universal Protein Resource (UniProt): an expanding universe of protein information. Nucleic Acids Research, 30(1), 15-18.
- Официальный сайт UniProt: uniprot.org
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →