Открыть сервис

UniProt

UniProt — это открытая, общедоступная база данных белковых последовательностей и функциональной информации о белках. Проект представляет собой централизованное хранилище, объединяющее данные из множества источников, и является одним из ключевых ресурсов в биоинформатике и молекулярной биологии. UniProt поддерживается консорциумом, в который входят Европейский институт биоинформатики (EBI), Институт биоинформатики Швейцарии (SIB) и Исследовательский центр по белковой информации (PIR) в США.

История

Проект UniProt был создан в 2002 году в результате слияния трёх крупных баз данных белков: Swiss-Prot, TrEMBL и PIR-PSD. Каждая из этих баз имела свою историю и специализацию.

  • Swiss-Prot была основана в 1986 году Амосом Байрохом (Швейцарский институт биоинформатики) и начала вестись в сотрудничестве с EBI. Она отличалась высоким качеством аннотаций, которые вручную проверялись экспертами.
  • TrEMBL (Translated EMBL Nucleotide Sequence Data Library) была создана в 1996 году как автоматически аннотируемое дополнение к Swiss-Prot. Она содержала переводы всех последовательностей, загруженных в базу данных нуклеотидных последовательностей EMBL-Bank, которые ещё не были включены в Swiss-Prot.
  • PIR-PSD (Protein Information Resource — Protein Sequence Database) была одной из старейших баз данных белков, созданной в 1984 году Национальным биомедицинским исследовательским фондом (NBRF) в США.

Объединение этих ресурсов в единый консорциум позволило устранить дублирование, повысить качество данных и создать единую точку доступа для исследователей по всему миру. С тех пор UniProt постоянно развивается, добавляя новые типы данных и улучшая инструменты поиска.

Структура и основные компоненты

UniProt состоит из нескольких взаимосвязанных баз данных, каждая из которых выполняет свою функцию.

UniProtKB (UniProt Knowledgebase)

Это центральная база знаний, содержащая основную информацию о белках. Она делится на два раздела:

  • UniProtKB/Swiss-Prot: Раздел с аннотациями, прошедшими экспертную проверку вручную. Каждая запись в Swiss-Prot содержит тщательно выверенную информацию о функции белка, его доменной структуре, посттрансляционных модификациях, клеточной локализации, взаимодействиях с другими молекулами, а также ссылки на литературные источники. Записи Swiss-Prot отличаются высокой достоверностью, но их количество ограничено (около 570 000 записей на начало 2024 года).
  • UniProtKB/TrEMBL: Раздел с автоматически аннотированными записями, которые не прошли ручную проверку. Эти записи генерируются на основе компьютерного анализа и содержат предсказанную информацию. TrEMBL значительно больше Swiss-Prot (более 250 миллионов записей) и охватывает практически все известные белковые последовательности, включая те, которые были получены в результате крупномасштабных геномных проектов.

UniRef (UniProt Reference Clusters)

UniRef — это база данных кластеров последовательностей, созданная для уменьшения избыточности и ускорения поиска. Белковые последовательности из UniProtKB и других источников группируются в кластеры на основе заданного уровня идентичности (например, 100%, 90% или 50%). Для каждого кластера выбирается репрезентативная последовательность, что позволяет проводить поиск по меньшему, но репрезентативному набору данных.

UniParc (UniProt Archive)

UniParc — это архив, который хранит все версии всех белковых последовательностей, когда-либо появлявшихся в публичных базах данных. Он служит для отслеживания изменений в последовательностях и позволяет проследить историю каждой записи. В отличие от UniProtKB, UniParc не содержит аннотаций, а только сами последовательности и их идентификаторы.

Функциональные возможности

UniProt предоставляет широкий спектр инструментов для анализа и поиска данных.

Поиск и навигация

Пользовательский интерфейс позволяет выполнять поиск по различным критериям: названию белка, названию гена, таксономии, ключевым словам, идентификаторам из других баз данных (например, RefSeq, PDB) и по тексту аннотаций. Результаты поиска можно фильтровать и сортировать.

Инструменты анализа последовательностей

  • BLAST (Basic Local Alignment Search Tool): Позволяет находить сходные последовательности в базе данных UniProt по заданной последовательности пользователя.
  • Align: Инструмент для множественного выравнивания последовательностей.
  • Peptide Search: Позволяет находить белки, содержащие заданную пептидную последовательность.

Интеграция с другими ресурсами

UniProt тесно интегрирован с другими биоинформатическими базами данных, такими как:

  • PDB (Protein Data Bank) — для трёхмерных структур белков.
  • Ensembl и NCBI — для геномных данных.
  • Gene Ontology (GO) — для стандартизированной терминологии функций, процессов и компонентов клетки.
  • Reactome и KEGG — для путей метаболизма и сигнальных каскадов.
  • PubMed — для ссылок на научные статьи.

Применение

UniProt является незаменимым инструментом для широкого круга исследователей в области биологии, медицины и биотехнологии.

  • Фундаментальные исследования: Изучение эволюции белков, их структуры и функции. Сравнительный анализ последовательностей из разных организмов.
  • Медицина: Поиск генетических вариантов, связанных с заболеваниями. Идентификация белков-мишеней для лекарственных препаратов. Анализ мутаций в белках, вызывающих наследственные болезни.
  • Биотехнология: Разработка ферментов для промышленного использования. Инженерия белков с заданными свойствами.
  • Протеомика: Идентификация и количественный анализ белков в биологических образцах (например, с помощью масс-спектрометрии). UniProt служит эталонной базой для интерпретации результатов протеомных экспериментов.

Критика и ограничения

Несмотря на свою ценность, UniProt имеет некоторые ограничения.

  • Неполнота аннотаций: Для многих белков, особенно из малоизученных организмов, информация в Swiss-Prot отсутствует, а в TrEMBL она может быть неточной или предсказательной.
  • Задержка обновлений: Хотя база данных обновляется регулярно, между появлением новой информации в научной литературе и её включением в Swiss-Prot может пройти значительное время.
  • Сложность для новичков: Интерфейс и инструменты UniProt могут быть сложными для пользователей, не имеющих опыта в биоинформатике.
  • Зависимость от других баз данных: Качество аннотаций в TrEMBL напрямую зависит от качества данных, подаваемых в нуклеотидные базы данных (например, GenBank). Ошибки в первичных данных могут распространяться на UniProt.

Интересные факты

  • Название «UniProt» происходит от английских слов «Universal Protein Resource» (Универсальный белковый ресурс).
  • Каждая запись в UniProtKB имеет уникальный идентификатор (например, P04637 для белка p53 человека), который широко используется в научной литературе.
  • Проект UniProt является одним из крупнейших и наиболее активно используемых ресурсов в биоинформатике, обрабатывая миллионы запросов от исследователей по всему миру ежедневно.
  • Консорциум UniProt активно участвует в разработке стандартов для представления биологических данных, таких как FAIR (Findable, Accessible, Interoperable, Reusable) принципы.

Источники

  • UniProt Consortium. (2023). UniProt: the Universal Protein Knowledgebase in 2023. Nucleic Acids Research, 51(D1), D523-D531.
  • Bairoch, A., & Apweiler, R. (2000). The SWISS-PROT protein sequence database and its supplement TrEMBL in 2000. Nucleic Acids Research, 28(1), 45-48.
  • Wu, C. H., et al. (2002). The Universal Protein Resource (UniProt): an expanding universe of protein information. Nucleic Acids Research, 30(1), 15-18.
  • Официальный сайт UniProt: uniprot.org

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →