GenBank
GenBank — это открытая, публично доступная база данных нуклеотидных последовательностей, созданная и поддерживаемая Национальным центром биотехнологической информации (NCBI), входящим в состав Национальной медицинской библиотеки США (NLM). GenBank является крупнейшим в мире репозиторием генетических данных, принимающим, хранящим и распространяющий аннотированные последовательности ДНК и РНК, предоставленные исследователями со всего мира. База данных служит фундаментальным ресурсом для молекулярной биологии, генетики, эволюционной биологии, медицины и биоинформатики.
История
Создание и ранние годы
Проект GenBank был официально запущен в 1982 году как часть усилий по созданию централизованного хранилища для растущего объёма данных о последовательностях ДНК. Первоначально база данных управлялась Национальным институтом общих медицинских наук (NIGMS) и Национальным научным фондом (NSF). Первая версия содержала всего 680 последовательностей, общая длина которых составляла около 680 000 пар оснований. Данные поступали в основном из лабораторий, занимающихся секвенированием генов, и вводились вручную.
Переход к NCBI
В 1992 году управление GenBank было передано Национальному центру биотехнологической информации (NCBI), который был создан в 1988 году для разработки и поддержки вычислительных ресурсов для молекулярной биологии. Переход к NCBI позволил автоматизировать процессы приёма, аннотации и поиска данных, а также интегрировать GenBank с другими базами данных NCBI, такими как PubMed, RefSeq и Protein.
Эра высокопроизводительного секвенирования
С началом проектов по секвенированию геномов, таких как проект «Геном человека» (1990–2003), объём данных в GenBank начал расти экспоненциально. Появление технологий секвенирования нового поколения (NGS) в середине 2000-х годов привело к взрывному росту числа последовательностей. К 2023 году GenBank содержал более 250 миллиардов пар оснований в более чем 2 миллиардах последовательностей, поступающих от сотен тысяч исследователей и организаций по всему миру.
Структура и организация
Основные компоненты
GenBank организован в виде нескольких взаимосвязанных разделов, каждый из которых имеет свою специфику:
- EST (Expressed Sequence Tags): короткие, однопроходные последовательности кДНК, используемые для идентификации генов и изучения экспрессии.
- GSS (Genome Survey Sequences): короткие последовательности геномной ДНК, часто используемые для картирования геномов.
- HTGS (High-Throughput Genomic Sequences): последовательности геномов, полученные с помощью высокопроизводительных методов секвенирования, часто в стадии сборки.
- WGS (Whole Genome Shotgun): последовательности геномов, полученные методом дробовика (shotgun) и собранные в контиги.
- TSA (Transcriptome Shotgun Assembly): сборки транскриптомов (РНК-последовательностей), полученные с помощью NGS.
- CoreNucleotide: основная часть базы данных, содержащая аннотированные, отредактированные и проверенные последовательности, включая полные гены, геномы и РНК.
Формат записи
Каждая запись в GenBank имеет стандартизированный формат, включающий следующие поля:
- LOCUS: имя записи, длина последовательности, тип молекулы (ДНК, РНК), дата последнего обновления.
- DEFINITION: краткое описание последовательности (например, «Homo sapiens mRNA for beta-globin»).
- ACCESSION: уникальный идентификатор записи (например, NM_000518), который не меняется при обновлениях.
- VERSION: номер версии записи, включающий GI (GenInfo Identifier) — уникальный числовой идентификатор.
- KEYWORDS: ключевые слова, описывающие последовательность.
- SOURCE: организм, из которого получена последовательность, с таксономической информацией.
- REFERENCE: ссылки на публикации, в которых описана последовательность (авторы, журнал, год).
- FEATURES: аннотация функциональных элементов (гены, экзоны, интроны, кодирующие области, регуляторные участки, вариации).
- ORIGIN: сама нуклеотидная последовательность в формате FASTA.
Идентификаторы
Каждая последовательность имеет уникальный идентификатор (accession number), который состоит из букв и цифр (например, AB123456). Для версий используется суффикс (например, AB123456.1). GI-номер — это числовой идентификатор, который присваивается каждой версии последовательности и используется для внутреннего учёта.
Процесс подачи данных
Субмиссия
Любой исследователь может подать последовательность в GenBank через систему BankIt (веб-интерфейс) или Sequin (автономное программное обеспечение). Для массовых загрузок используется Submission Portal NCBI. При подаче требуется указать:
- Последовательность в формате FASTA.
- Аннотацию (гены, функции, координаты).
- Таксономическую информацию об организме.
- Ссылки на публикации (если есть).
Проверка и аннотация
NCBI проводит автоматическую и ручную проверку данных на наличие ошибок, дубликатов и соответствие стандартам. Аннотация может быть дополнена автоматическими инструментами, такими как GeneMark или Prokka, но окончательная ответственность за качество лежит на подающем. После проверки последовательность получает accession number и становится общедоступной.
Сроки публикации
По умолчанию данные становятся доступными сразу после обработки. Однако исследователи могут запросить задержку публикации (embargo) до выхода статьи, обычно на срок до 12 месяцев.
Международное сотрудничество
Международная база данных последовательностей (INSDC)
GenBank является частью Международной базы данных последовательностей (International Nucleotide Sequence Database Collaboration, INSDC), которая включает три основных партнёра:
- GenBank (США, NCBI).
- EMBL-EBI (Европейский институт биоинформатики, Великобритания) — база данных ENA (European Nucleotide Archive).
- DDBJ (Япония, Национальный институт генетики) — база данных DDBJ (DNA Data Bank of Japan).
Эти три организации ежедневно обмениваются данными, обеспечивая синхронизацию и глобальный доступ. Таким образом, любая последовательность, поданная в одну из баз, автоматически становится доступной в двух других.
Преимущества сотрудничества
- Единый стандарт аннотации и формата.
- Глобальное покрытие: исследователи из любой страны могут подавать данные в ближайшую базу.
- Резервирование: данные хранятся на нескольких серверах, что предотвращает потерю информации.
Применение
Фундаментальные исследования
GenBank является основным источником данных для:
- Сравнительной геномики: изучение эволюционных связей, поиск гомологов, анализ консервативных участков.
- Филогенетики: построение эволюционных деревьев на основе последовательностей.
- Функциональной геномики: аннотация генов, предсказание функций белков.
- Метагеномики: анализ генетического материала, выделенного из образцов окружающей среды (почва, вода, кишечник).
Медицина и биотехнология
- Диагностика заболеваний: идентификация патогенов по их генетическим последовательностям (например, SARS-CoV-2, ВИЧ, туберкулёз).
- Фармакогеномика: изучение генетических вариаций, влияющих на ответ на лекарства.
- Разработка вакцин: использование последовательностей для создания мРНК-вакцин и рекомбинантных белков.
- Генетическая инженерия: поиск и клонирование генов для создания трансгенных организмов.
Сельское хозяйство и экология
- Селекция растений и животных: идентификация генов, отвечающих за урожайность, устойчивость к болезням, засухоустойчивость.
- Биоремедиация: поиск микроорганизмов, способных разлагать загрязнители.
- Мониторинг биоразнообразия: использование метабаркодинга для оценки видового состава сообществ.
Критика и ограничения
Качество данных
Одной из основных проблем GenBank является неоднородность качества данных. Многие последовательности подаются без достаточной аннотации или с ошибками, что может привести к неверным выводам. Например, в некоторых записях могут быть неправильно указаны границы генов или функции белков. NCBI предпринимает меры по улучшению качества, но полностью устранить ошибки невозможно из-за огромного объёма данных.
Этические и правовые вопросы
- Конфиденциальность: данные о геномах человека, особенно с клинической информацией, могут быть использованы для дискриминации (например, при страховании или трудоустройстве). NCBI анонимизирует данные, но полная анонимность не гарантируется.
- Биопиратство: использование генетических ресурсов из развивающихся стран без справедливого распределения выгод (например, коммерческое использование генов растений или микроорганизмов). В ответ на это были разработаны механизмы, такие как Nagoya Protocol (2010), но их реализация сложна.
- Двойное использование: последовательности патогенов (например, вирусов гриппа или сибирской язвы) могут быть использованы для создания биооружия. NCBI ограничивает доступ к некоторым данным, но это вызывает споры о свободе информации.
Технические ограничения
- Объём данных: хранение и обработка петабайт информации требуют значительных вычислительных ресурсов. NCBI использует распределённые системы хранения, но для пользователей с медленным интернетом загрузка больших наборов данных может быть проблемой.
- Стандартизация: несмотря на усилия INSDC, разные базы данных могут использовать разные форматы и аннотации, что усложняет интеграцию.
Интересные факты
- Рост данных: в 1982 году GenBank содержал 680 последовательностей; к 2023 году — более 2 миллиардов. Это соответствует экспоненциальному росту, удваивающемуся каждые 18–24 месяца.
- Самый длинный геном: в GenBank хранится последовательность генома растения Paris japonica (японский парис), длина которого составляет около 150 миллиардов пар оснований — это самый большой известный геном.
- Самый короткий геном: геном вируса Hepatitis B (HBV) составляет всего около 3,2 тысяч пар оснований.
- Человеческий геном: полная последовательность генома человека (GRCh38) занимает около 3,2 миллиарда пар оснований и представлена в GenBank в виде нескольких записей.
- Использование в пандемии: во время пандемии COVID-19 в GenBank было загружено более 15 миллионов последовательностей SARS-CoV-2, что позволило отслеживать мутации и разрабатывать вакцины.
Источники
- Benson, D. A., Cavanaugh, M., Clark, K., Karsch-Mizrachi, I., Lipman, D. J., Ostell, J., & Sayers, E. W. (2013). GenBank. Nucleic Acids Research, 41(D1), D36-D42.
- Sayers, E. W., Bolton, E. E., Brister, J. R., Canese, K., Chan, J., Comeau, D. C., ... & Ostell, J. (2022). Database resources of the National Center for Biotechnology Information. Nucleic Acids Research, 50(D1), D20-D26.
- International Nucleotide Sequence Database Collaboration (INSDC). (2021). The INSDC: a global collaboration to provide open access to nucleotide sequence data. Nucleic Acids Research, 49(D1), D1-D6.
- NCBI. (2023). GenBank Overview. National Center for Biotechnology Information. https://www.ncbi.nlm.nih.gov/genbank/
- Cochrane, G., Karsch-Mizrachi, I., & Takagi, T. (2016). The International Nucleotide Sequence Database Collaboration. Nucleic Acids Research, 44(D1), D48-D50.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →