Национальный центр биотехнологической информации
Национальный центр биотехнологической информации (англ. National Center for Biotechnology Information, NCBI) — подразделение Национальной медицинской библиотеки США (NLM), входящей в состав Национальных институтов здравоохранения (NIH). NCBI является одним из крупнейших в мире хранилищ молекулярно-биологических, генетических и биохимических данных, а также разработчиком программных инструментов для анализа и распространения этой информации. Центр был основан в 1988 году и с тех пор играет ключевую роль в развитии биоинформатики и геномики.
История
Создание NCBI было инициировано Конгрессом США в 1988 году в ответ на стремительное развитие методов секвенирования ДНК и накопление генетических данных. Первоначально центр был создан для управления растущим объёмом информации о нуклеотидных последовательностях, которая поступала в базу данных GenBank. В 1992 году NCBI взял на себя официальное администрирование GenBank, которая до этого управлялась частными организациями.
В 1990-е годы, с началом проекта «Геном человека», NCBI стал центральным узлом для хранения и анализа данных, получаемых в ходе секвенирования геномов различных организмов. В 2000-е годы центр расширил свою деятельность, включив в неё базы данных по белкам, генным экспрессиям, вариациям генома (SNP), а также разработал мощные поисковые системы, такие как Entrez и BLAST.
Основные базы данных
NCBI поддерживает десятки интегрированных баз данных, которые охватывают практически все аспекты молекулярной биологии. Наиболее значимые из них:
GenBank
GenBank — это общедоступная база данных всех нуклеотидных последовательностей, аннотированных и депонированных научным сообществом. Она является частью Международного сотрудничества по базам данных нуклеотидных последовательностей (INSDC), куда также входят DDBJ (Япония) и ENA (Европа). Ежедневно в GenBank добавляются тысячи новых записей, а общее число нуклеотидных последовательностей превышает миллиарды.
PubMed
PubMed — крупнейшая в мире библиографическая база данных по биомедицинским наукам. Она содержит более 35 миллионов ссылок на статьи из научных журналов, книги и другие источники. PubMed индексирует публикации с 1966 года по настоящее время, а также включает архивные записи с 1940-х годов. Доступ к базе данных бесплатный, что делает её основным инструментом для поиска научной литературы в области медицины, биологии и смежных дисциплин.
RefSeq
RefSeq (Reference Sequence Database) — это коллекция референсных последовательностей геномов, транскриптов и белков. В отличие от GenBank, где записи могут быть неполными или содержать ошибки, RefSeq предоставляет тщательно аннотированные и проверенные последовательности, которые служат эталоном для сравнительного анализа.
dbSNP
dbSNP (Database of Single Nucleotide Polymorphisms) — база данных однонуклеотидных полиморфизмов (SNP) и других малых генетических вариаций, таких как вставки и делеции. Она используется для изучения генетической изменчивости человека, ассоциаций с заболеваниями и популяционной генетики.
SRA
SRA (Sequence Read Archive) — архив данных секвенирования нового поколения (NGS). Он хранит «сырые» данные, полученные с секвенаторов, включая короткие прочтения (reads) и их качественные характеристики. SRA является крупнейшим в мире хранилищем такого рода данных.
Protein Data Bank (PDB)
Хотя PDB физически расположен в другом месте, NCBI предоставляет интеграцию с этой базой данных трёхмерных структур белков через свой инструментарий.
Инструменты и сервисы
NCBI разработал ряд программных инструментов, которые стали стандартом в биоинформатике.
BLAST
BLAST (Basic Local Alignment Search Tool) — это алгоритм для поиска гомологичных последовательностей в базах данных. Пользователь может ввести нуклеотидную или белковую последовательность, и BLAST найдёт все похожие последовательности в GenBank или других базах. BLAST доступен через веб-интерфейс и в виде локальной версии для установки на компьютер. Существует несколько вариантов BLAST: blastn (нуклеотиды), blastp (белки), blastx (нуклеотиды, переведённые в белки) и другие.
Entrez
Entrez — это интегрированная поисковая система, которая позволяет одновременно искать информацию во всех базах данных NCBI. Она поддерживает сложные запросы с использованием логических операторов, фильтров и полей. Entrez также предоставляет ссылки между записями из разных баз (например, от статьи в PubMed к соответствующей нуклеотидной последовательности в GenBank).
Primer-BLAST
Primer-BLAST — инструмент для проектирования праймеров для ПЦР. Он позволяет подобрать олигонуклеотиды, специфичные для заданной последовательности, и проверяет их на отсутствие нецелевых связываний в геноме.
COBALT
COBALT (Constraint-based Multiple Alignment Tool) — инструмент для множественного выравнивания белковых последовательностей, который учитывает консервативные участки и структурные ограничения.
ClinVar
ClinVar — база данных, связывающая генетические варианты с клиническими фенотипами. Она используется для интерпретации результатов генетического тестирования и диагностики наследственных заболеваний.
Значение и применение
NCBI является незаменимым ресурсом для научных исследований в области генетики, молекулярной биологии, медицины и фармакологии. Его данные используются для:
- Сравнительной геномики: учёные сравнивают геномы разных организмов для изучения эволюции и функций генов.
- Диагностики заболеваний: ClinVar и dbSNP помогают идентифицировать мутации, связанные с наследственными болезнями.
- Разработки лекарств: анализ белковых структур и последовательностей используется для поиска мишеней и дизайна молекул.
- Эпидемиологии: в период пандемии COVID-19 NCBI активно пополнял базу SRA данными о геномах коронавируса, что позволило отслеживать его мутации и распространение.
- Образования: студенты и преподаватели используют PubMed и GenBank для обучения и написания научных работ.
Критика и ограничения
Несмотря на свою важность, NCBI сталкивается с рядом проблем. Во-первых, объём данных растёт экспоненциально, что требует постоянного увеличения вычислительных мощностей и хранилищ. Во-вторых, качество аннотаций в GenBank не всегда высокое, так как записи депонируются самими исследователями и могут содержать ошибки. В-третьих, существует проблема дублирования данных и неполноты метаданных.
Кроме того, NCBI является американским государственным учреждением, что может вызывать вопросы о доступе к данным для исследователей из стран, находящихся под санкциями США. Однако в целом NCBI остаётся открытым и бесплатным ресурсом для всего мира.
Интересные факты
- В 2013 году NCBI запустил проект PubMed Commons, который позволял оставлять комментарии к статьям, но в 2018 году он был закрыт из-за низкой активности.
- База данных GenBank удваивается в размере примерно каждые 18 месяцев, что соответствует закону Мура.
- В 2020 году, во время пандемии COVID-19, NCBI создал специальный раздел SARS-CoV-2 Resources, где были собраны все данные о коронавирусе.
См. также
- Биоинформатика
- Геном человека
- Европейский институт биоинформатики (EBI)
- UniProt
Источники
- National Center for Biotechnology Information. About NCBI. — Bethesda, MD: National Library of Medicine, 2023.
- Benson D.A., Cavanaugh M., Clark K., et al. GenBank. // Nucleic Acids Research. — 2023. — Vol. 51, № D1. — P. D1–D8.
- Sayers E.W., Bolton E.E., Brister J.R., et al. Database resources of the National Center for Biotechnology Information. // Nucleic Acids Research. — 2022. — Vol. 50, № D1. — P. D20–D26.
- Altschul S.F., Gish W., Miller W., et al. Basic local alignment search tool. // Journal of Molecular Biology. — 1990. — Vol. 215, № 3. — P. 403–410.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →