Открыть сервис

Национальный центр биотехнологической информации США

NCBI (National Center for Biotechnology Information) — подразделение Национальной медицинской библиотеки США (NLM), входящей в состав Национальных институтов здоровья (NIH). Центр основан в 1988 году для развития биоинформатики, создания и поддержания молекулярно-биологических баз данных, а также для обеспечения доступа научного сообщества к этим ресурсам. NCBI является одним из крупнейших в мире хранилищ биологических данных, включая нуклеотидные последовательности, белки, научные публикации и генетические вариации.

История

Решение о создании NCBI было принято Конгрессом США в 1988 году в ответ на растущую потребность в компьютерной обработке и хранении данных о последовательностях ДНК и белков. Первым директором центра стал Дэвид Липман, занимавший этот пост до 2023 года. Изначально NCBI развивался как преемник базы данных GenBank, которая велась в Национальном институте исследования генома человека. С течением времени центр расширил спектр задач, включив в них разработку программного обеспечения для анализа генетической информации, создание инструментов поиска (таких как BLAST) и интеграцию разнородных биомедицинских данных.

Основные базы данных

GenBank

GenBank — ключевая база данных NCBI, содержащая аннотированные нуклеотидные последовательности, предоставляемые исследователями со всего мира. По состоянию на 2024 год GenBank включает более 250 миллионов последовательностей. Данные в GenBank свободно доступны и регулярно синхронизируются с международными партнёрами — Европейским архивом нуклеотидов (ENA) и Банком данных ДНК Японии (DDBJ).

PubMed

PubMed — библиографическая база данных, насчитывающая свыше 35 миллионов записей о биомедицинских статьях из более чем 5000 журналов. Она охватывает медицину, фармакологию, молекулярную биологию, генетику и смежные дисциплины. PubMed интегрирован с полнотекстовым архивом PMC (PubMed Central), где размещаются открытые версии статей.

RefSeq

База RefSeq (Reference Sequence) содержит эталонные, вручную аннотированные последовательности геномов, транскриптов и белков. В отличие от GenBank, записи RefSeq не дублируются и служат стандартом для сравнения при анализе новых последовательностей.

Прочие ресурсы

К числу значимых ресурсов NCBI относятся: база данных белков Protein, база вариаций dbSNP (более 1 миллиарда записей о однонуклеотидных полиморфизмах), база генов Gene, ресурс для сравнения геномов HomoloGene, база ферментов и метаболических путей BioSystems, а также архив высокопроизводительных экспериментов SRA (Sequence Read Archive).

Инструменты анализа

BLAST

BLAST (Basic Local Alignment Search Tool) — один из наиболее используемых биоинформатических инструментов в мире. Он позволяет находить гомологичные последовательности в базах данных по заданному фрагменту ДНК или белка. BLAST доступен как через веб-интерфейс, так и в виде локально устанавливаемого программного обеспечения.

Прочие сервисы

Центр предоставляет инструменты множественного выравнивания (COBALT), поиска консервативных доменов (CD-Search), предсказания структуры белков (Cn3D), а также набор утилит E-utilities для программного доступа к данным через API. Для филогенетического анализа используется инструмент Tree Viewer.

Международное сотрудничество

NCBI участвует в работе Международного консорциума по последовательностям нуклеотидов (INSDC), обеспечивающего глобальный обмен генетическими данными. Центр также входит в проект Ensembl по аннотации геномов позвоночных и сотрудничает с Европейской молекулярно-биологической лабораторией (EMBL) и Институтом биоинформатики (EBI).

Значение и применение

Ресурсы NCBI используются в фундаментальной и прикладной науке: от изучения эволюции и филогении до диагностики наследственных заболеваний и разработки лекарственных препаратов. В период пандемии COVID-19 базы данных NCBI сыграли ключевую роль в оперативном депонировании и анализе геномов коронавируса SARS-CoV-2. Клинические генетики применяют базу ClinVar для интерпретации патогенности генетических вариантов, а фармакологи используют данные о структурах белков для компьютерного дизайна лекарств.

Национальный центр биотехнологической информации остаётся эталонным примером открытой научной инфраструктуры, обеспечивающей свободный доступ к данным для исследователей по всему миру без ограничений по гражданству или месту работы.

Источники

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →