Открыть сервис

Национальный центр биотехнологической информации

Национальный центр биотехнологической информации (англ. National Center for Biotechnology Information, NCBI) — подразделение Национальной медицинской библиотеки США (NLM), входящей в состав Национальных институтов здравоохранения (NIH). NCBI является одним из крупнейших в мире хранилищ молекулярно-биологических, генетических и биохимических данных, а также разработчиком программных инструментов для анализа и распространения этой информации. Центр был основан в 1988 году и с тех пор играет ключевую роль в развитии биоинформатики и геномики.

История

Создание NCBI было инициировано Конгрессом США в 1988 году в ответ на стремительное развитие методов секвенирования ДНК и накопление генетических данных. Первоначально центр был создан для управления растущим объёмом информации о нуклеотидных последовательностях, которая поступала в базу данных GenBank. В 1992 году NCBI взял на себя официальное администрирование GenBank, которая до этого управлялась частными организациями.

В 1990-е годы, с началом проекта «Геном человека», NCBI стал центральным узлом для хранения и анализа данных, получаемых в ходе секвенирования геномов различных организмов. В 2000-е годы центр расширил свою деятельность, включив в неё базы данных по белкам, генным экспрессиям, вариациям генома (SNP), а также разработал мощные поисковые системы, такие как Entrez и BLAST.

Основные базы данных

NCBI поддерживает десятки интегрированных баз данных, которые охватывают практически все аспекты молекулярной биологии. Наиболее значимые из них:

GenBank

GenBank — это общедоступная база данных всех нуклеотидных последовательностей, аннотированных и депонированных научным сообществом. Она является частью Международного сотрудничества по базам данных нуклеотидных последовательностей (INSDC), куда также входят DDBJ (Япония) и ENA (Европа). Ежедневно в GenBank добавляются тысячи новых записей, а общее число нуклеотидных последовательностей превышает миллиарды.

PubMed

PubMed — крупнейшая в мире библиографическая база данных по биомедицинским наукам. Она содержит более 35 миллионов ссылок на статьи из научных журналов, книги и другие источники. PubMed индексирует публикации с 1966 года по настоящее время, а также включает архивные записи с 1940-х годов. Доступ к базе данных бесплатный, что делает её основным инструментом для поиска научной литературы в области медицины, биологии и смежных дисциплин.

RefSeq

RefSeq (Reference Sequence Database) — это коллекция референсных последовательностей геномов, транскриптов и белков. В отличие от GenBank, где записи могут быть неполными или содержать ошибки, RefSeq предоставляет тщательно аннотированные и проверенные последовательности, которые служат эталоном для сравнительного анализа.

dbSNP

dbSNP (Database of Single Nucleotide Polymorphisms) — база данных однонуклеотидных полиморфизмов (SNP) и других малых генетических вариаций, таких как вставки и делеции. Она используется для изучения генетической изменчивости человека, ассоциаций с заболеваниями и популяционной генетики.

SRA

SRA (Sequence Read Archive) — архив данных секвенирования нового поколения (NGS). Он хранит «сырые» данные, полученные с секвенаторов, включая короткие прочтения (reads) и их качественные характеристики. SRA является крупнейшим в мире хранилищем такого рода данных.

Protein Data Bank (PDB)

Хотя PDB физически расположен в другом месте, NCBI предоставляет интеграцию с этой базой данных трёхмерных структур белков через свой инструментарий.

Инструменты и сервисы

NCBI разработал ряд программных инструментов, которые стали стандартом в биоинформатике.

BLAST

BLAST (Basic Local Alignment Search Tool) — это алгоритм для поиска гомологичных последовательностей в базах данных. Пользователь может ввести нуклеотидную или белковую последовательность, и BLAST найдёт все похожие последовательности в GenBank или других базах. BLAST доступен через веб-интерфейс и в виде локальной версии для установки на компьютер. Существует несколько вариантов BLAST: blastn (нуклеотиды), blastp (белки), blastx (нуклеотиды, переведённые в белки) и другие.

Entrez

Entrez — это интегрированная поисковая система, которая позволяет одновременно искать информацию во всех базах данных NCBI. Она поддерживает сложные запросы с использованием логических операторов, фильтров и полей. Entrez также предоставляет ссылки между записями из разных баз (например, от статьи в PubMed к соответствующей нуклеотидной последовательности в GenBank).

Primer-BLAST

Primer-BLAST — инструмент для проектирования праймеров для ПЦР. Он позволяет подобрать олигонуклеотиды, специфичные для заданной последовательности, и проверяет их на отсутствие нецелевых связываний в геноме.

COBALT

COBALT (Constraint-based Multiple Alignment Tool) — инструмент для множественного выравнивания белковых последовательностей, который учитывает консервативные участки и структурные ограничения.

ClinVar

ClinVar — база данных, связывающая генетические варианты с клиническими фенотипами. Она используется для интерпретации результатов генетического тестирования и диагностики наследственных заболеваний.

Значение и применение

NCBI является незаменимым ресурсом для научных исследований в области генетики, молекулярной биологии, медицины и фармакологии. Его данные используются для:

  • Сравнительной геномики: учёные сравнивают геномы разных организмов для изучения эволюции и функций генов.
  • Диагностики заболеваний: ClinVar и dbSNP помогают идентифицировать мутации, связанные с наследственными болезнями.
  • Разработки лекарств: анализ белковых структур и последовательностей используется для поиска мишеней и дизайна молекул.
  • Эпидемиологии: в период пандемии COVID-19 NCBI активно пополнял базу SRA данными о геномах коронавируса, что позволило отслеживать его мутации и распространение.
  • Образования: студенты и преподаватели используют PubMed и GenBank для обучения и написания научных работ.

Критика и ограничения

Несмотря на свою важность, NCBI сталкивается с рядом проблем. Во-первых, объём данных растёт экспоненциально, что требует постоянного увеличения вычислительных мощностей и хранилищ. Во-вторых, качество аннотаций в GenBank не всегда высокое, так как записи депонируются самими исследователями и могут содержать ошибки. В-третьих, существует проблема дублирования данных и неполноты метаданных.

Кроме того, NCBI является американским государственным учреждением, что может вызывать вопросы о доступе к данным для исследователей из стран, находящихся под санкциями США. Однако в целом NCBI остаётся открытым и бесплатным ресурсом для всего мира.

Интересные факты

  • В 2013 году NCBI запустил проект PubMed Commons, который позволял оставлять комментарии к статьям, но в 2018 году он был закрыт из-за низкой активности.
  • База данных GenBank удваивается в размере примерно каждые 18 месяцев, что соответствует закону Мура.
  • В 2020 году, во время пандемии COVID-19, NCBI создал специальный раздел SARS-CoV-2 Resources, где были собраны все данные о коронавирусе.

См. также

  • Биоинформатика
  • Геном человека
  • Европейский институт биоинформатики (EBI)
  • UniProt

Источники

  • National Center for Biotechnology Information. About NCBI. — Bethesda, MD: National Library of Medicine, 2023.
  • Benson D.A., Cavanaugh M., Clark K., et al. GenBank. // Nucleic Acids Research. — 2023. — Vol. 51, № D1. — P. D1–D8.
  • Sayers E.W., Bolton E.E., Brister J.R., et al. Database resources of the National Center for Biotechnology Information. // Nucleic Acids Research. — 2022. — Vol. 50, № D1. — P. D20–D26.
  • Altschul S.F., Gish W., Miller W., et al. Basic local alignment search tool. // Journal of Molecular Biology. — 1990. — Vol. 215, № 3. — P. 403–410.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →