Национальный центр биотехнологической информации США¶
NCBI (National Center for Biotechnology Information) — подразделение Национальной медицинской библиотеки США (NLM), входящей в состав Национальных институтов здоровья (NIH). Центр основан в 1988 году для развития биоинформатики, создания и поддержания молекулярно-биологических баз данных, а также для обеспечения доступа научного сообщества к этим ресурсам. NCBI является одним из крупнейших в мире хранилищ биологических данных, включая нуклеотидные последовательности, белки, научные публикации и генетические вариации.
¶История
Решение о создании NCBI было принято Конгрессом США в 1988 году в ответ на растущую потребность в компьютерной обработке и хранении данных о последовательностях ДНК и белков. Первым директором центра стал Дэвид Липман, занимавший этот пост до 2023 года. Изначально NCBI развивался как преемник базы данных GenBank, которая велась в Национальном институте исследования генома человека. С течением времени центр расширил спектр задач, включив в них разработку программного обеспечения для анализа генетической информации, создание инструментов поиска (таких как BLAST) и интеграцию разнородных биомедицинских данных.
¶Основные базы данных
¶GenBank
GenBank — ключевая база данных NCBI, содержащая аннотированные нуклеотидные последовательности, предоставляемые исследователями со всего мира. По состоянию на 2024 год GenBank включает более 250 миллионов последовательностей. Данные в GenBank свободно доступны и регулярно синхронизируются с международными партнёрами — Европейским архивом нуклеотидов (ENA) и Банком данных ДНК Японии (DDBJ).
¶PubMed
PubMed — библиографическая база данных, насчитывающая свыше 35 миллионов записей о биомедицинских статьях из более чем 5000 журналов. Она охватывает медицину, фармакологию, молекулярную биологию, генетику и смежные дисциплины. PubMed интегрирован с полнотекстовым архивом PMC (PubMed Central), где размещаются открытые версии статей.
¶RefSeq
База RefSeq (Reference Sequence) содержит эталонные, вручную аннотированные последовательности геномов, транскриптов и белков. В отличие от GenBank, записи RefSeq не дублируются и служат стандартом для сравнения при анализе новых последовательностей.
¶Прочие ресурсы
К числу значимых ресурсов NCBI относятся: база данных белков Protein, база вариаций dbSNP (более 1 миллиарда записей о однонуклеотидных полиморфизмах), база генов Gene, ресурс для сравнения геномов HomoloGene, база ферментов и метаболических путей BioSystems, а также архив высокопроизводительных экспериментов SRA (Sequence Read Archive).
¶Инструменты анализа
¶BLAST
BLAST (Basic Local Alignment Search Tool) — один из наиболее используемых биоинформатических инструментов в мире. Он позволяет находить гомологичные последовательности в базах данных по заданному фрагменту ДНК или белка. BLAST доступен как через веб-интерфейс, так и в виде локально устанавливаемого программного обеспечения.
¶Прочие сервисы
Центр предоставляет инструменты множественного выравнивания (COBALT), поиска консервативных доменов (CD-Search), предсказания структуры белков (Cn3D), а также набор утилит E-utilities для программного доступа к данным через API. Для филогенетического анализа используется инструмент Tree Viewer.
¶Международное сотрудничество
NCBI участвует в работе Международного консорциума по последовательностям нуклеотидов (INSDC), обеспечивающего глобальный обмен генетическими данными. Центр также входит в проект Ensembl по аннотации геномов позвоночных и сотрудничает с Европейской молекулярно-биологической лабораторией (EMBL) и Институтом биоинформатики (EBI).
¶Значение и применение
Ресурсы NCBI используются в фундаментальной и прикладной науке: от изучения эволюции и филогении до диагностики наследственных заболеваний и разработки лекарственных препаратов. В период пандемии COVID-19 базы данных NCBI сыграли ключевую роль в оперативном депонировании и анализе геномов коронавируса SARS-CoV-2. Клинические генетики применяют базу ClinVar для интерпретации патогенности генетических вариантов, а фармакологи используют данные о структурах белков для компьютерного дизайна лекарств.
Национальный центр биотехнологической информации остаётся эталонным примером открытой научной инфраструктуры, обеспечивающей свободный доступ к данным для исследователей по всему миру без ограничений по гражданству или месту работы.
¶Источники
- Национальная медицинская библиотека США (NLM), официальный сайт NCBI.
- Документация GenBank и RefSeq, NCBI Handbook.
- Публикации NIH о развитии биоинформатической инфраструктуры.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
