Проект «1000 геномов
1000 геномов (англ. 1000 Genomes Project) — международный научно-исследовательский проект, целью которого было создание наиболее полного каталога вариаций генома человека, включая однонуклеотидные полиморфизмы (SNP), структурные варианты (вставки, делеции, инверсии) и вариации числа копий (CNV). Проект стартовал в 2008 году и завершил активную фазу сбора данных в 2015 году, опубликовав финальный набор данных. Он стал одним из крупнейших и наиболее цитируемых ресурсов в области геномики человека, предоставив базовую карту генетического разнообразия для популяционных и медицинских исследований.
История и предпосылки
Предшествующие проекты
До запуска «1000 геномов» основным эталоном генома человека служила последовательность, полученная в рамках Проекта «Геном человека» (1990–2003). Однако этот эталон представлял собой усреднённую последовательность, полученную от небольшого числа добровольцев, и не отражал всего разнообразия генетических вариаций в человеческих популяциях. Последующие проекты, такие как HapMap (2002–2009), картировали гаплотипы и общие SNP, но охватывали лишь частые варианты (с частотой встречаемости более 5 %). Для изучения редких вариантов (с частотой менее 1 %), которые могут играть ключевую роль в предрасположенности к заболеваниям, требовался более масштабный и глубокий подход.
Запуск проекта
Проект «1000 геномов» был официально объявлен в январе 2008 года. Инициаторами выступили международный консорциум, включавший учёных из Великобритании (Институт Сэнгера, Wellcome Trust), США (Национальный институт исследования генома человека — NHGRI, входящий в NIH), Китая (Пекинский институт геномики — BGI) и других стран. Финансирование осуществлялось главным образом через Wellcome Trust и Национальные институты здравоохранения США (NIH). Название проекта отражало амбициозную цель — секвенировать геномы не менее 1000 человек из разных популяций мира.
Методология
Выбор образцов и популяций
Для обеспечения максимального охвата генетического разнообразия были отобраны образцы ДНК от 2504 человек из 26 популяций, представляющих пять основных континентальных групп: африканскую, европейскую, восточноазиатскую, южноазиатскую и американскую. Среди популяций были, например, йоруба (Нигерия), японцы (Токио), китайцы (Пекин), финны, британцы, колумбийцы и другие. Критерии отбора включали отсутствие близкородственных связей между участниками и добровольное информированное согласие.
Технологии секвенирования
Проект использовал комбинацию трёх основных технологий секвенирования нового поколения (NGS):
- Секвенирование всего генома (WGS) — полное прочтение всей последовательности ДНК каждого участника на низком покрытии (в среднем 4–6×). Это позволяло выявлять как частые, так и редкие варианты, но с меньшей точностью для гетерозиготных позиций.
- Секвенирование экзома (WES) — целевое секвенирование только кодирующих областей генов (экзонов) на высоком покрытии (50–100×). Это давало высокую точность для вариантов в белок-кодирующих участках.
- Генотипирование с помощью SNP-чипов — использовалось для валидации и калибровки данных, а также для оценки качества.
Обработка данных и выявление вариантов
Все сырые данные секвенирования были выровнены на эталонный геном человека (сборка GRCh37, затем GRCh38). Для выявления вариантов применялись стандартизированные пайплайны, включающие такие инструменты, как GATK (Genome Analysis Toolkit) от Broad Institute. Варианты классифицировались по типу (SNP, инделы, структурные варианты) и частоте. Для оценки достоверности использовались статистические модели, а также кросс-валидация между разными технологиями и лабораториями.
Основные результаты
Каталог вариаций
Финальный набор данных (Phase 3, опубликованный в 2015 году) содержит:
- Более 84 миллионов однонуклеотидных полиморфизмов (SNP).
- Около 3,6 миллионов коротких инделов (вставок/делеций длиной до 50 пар оснований).
- Более 60 000 структурных вариантов (крупных делеций, дупликаций, инверсий).
- Более 500 000 вариаций числа копий (CNV).
Каждый вариант аннотирован с указанием его частоты в каждой из 26 популяций, а также в объединённых суперпопуляциях (например, «африканцы», «европейцы»). Это позволило оценить, какие варианты являются общими для всех людей, а какие — специфичными для отдельных групп.
Генетическое разнообразие человека
Проект подтвердил, что наибольшее генетическое разнообразие наблюдается в африканских популяциях, что согласуется с гипотезой африканского происхождения человека. В среднем два генома человека различаются примерно на 0,1 % (3 миллиона пар оснований), но это число варьирует в зависимости от популяции. Около 85 % всех вариантов являются редкими (частота менее 0,5 %), что подчёркивает важность крупных выборок для их обнаружения.
Влияние на медицинскую генетику
Каталог «1000 геномов» стал незаменимым инструментом для:
- Исследований ассоциаций «геном-заболевание» (GWAS) — позволяет корректировать результаты на популяционную стратификацию и выявлять истинные ассоциации.
- Фармакогеномики — помогает предсказывать реакцию на лекарства, основанную на генетических вариантах, частота которых различается между популяциями.
- Клинической диагностики — используется как референсный набор для фильтрации доброкачественных вариантов при секвенировании пациентов (например, в онкологии или редких наследственных заболеваниях).
Критика и ограничения
Неполнота охвата
Несмотря на название, проект охватил лишь 2504 образца, что далеко от 1000 геномов в первоначальном замысле (на самом деле — 2504 генома). Для полного представления о редких вариантах, особенно в малоизученных популяциях (например, коренных народов Сибири или Австралии), требуются гораздо более масштабные выборки. Кроме того, проект не включал образцы из России и многих регионов Центральной Азии, что ограничивает его применимость для этих популяций.
Технические ограничения
Секвенирование на низком покрытии (4–6×) приводило к пропуску некоторых гетерозиготных вариантов и снижению точности для структурных вариантов. Современные технологии (например, секвенирование длинными прочтениями от PacBio или Oxford Nanopore) позволяют выявлять такие варианты с гораздо большей точностью, но на момент проекта они были недоступны в массовом масштабе.
Этические аспекты
Сбор образцов у представителей популяций, которые ранее были мало изучены, вызвал дискуссии о согласии, конфиденциальности и возможной стигматизации. Хотя все образцы были анонимизированы, остаётся риск повторной идентификации участников по генетическим данным. Проект также не предусматривал возврата индивидуальных результатов участникам, что критиковалось некоторыми этическими комитетами.
Наследие и дальнейшее развитие
Создание более крупных проектов
«1000 геномов» стал прототипом для последующих масштабных популяционных геномных проектов, таких как:
- UK Biobank (Великобритания) — секвенирование геномов 500 000 участников.
- All of Us (США) — цель — секвенировать более 1 миллиона геномов, с акцентом на разнообразие популяций.
- GenomeAsia 100K — проект, нацеленный на секвенирование 100 000 геномов азиатских популяций.
Открытый доступ к данным
Все данные проекта «1000 геномов» находятся в открытом доступе через базы данных, такие как European Genome-phenome Archive (EGA) и NCBI dbGaP. Это позволило тысячам исследователей по всему миру использовать их для своих работ, не требуя повторного сбора образцов.
Влияние на российскую геномику
В России данные «1000 геномов» используются в качестве референсного набора для популяционных исследований, например, при изучении генетического разнообразия народов Сибири и Кавказа. Однако из-за отсутствия российских образцов в проекте, российские учёные вынуждены дополнять его собственными данными, полученными в рамках проектов, таких как «Геном человека России» (Russian Genome Project).
Интересные факты
- Проект «1000 геномов» стал первым, кто систематически выявил миллионы редких вариантов, которые ранее были недоступны для изучения.
- В ходе проекта было обнаружено, что каждый человек несёт в среднем около 100–200 редких вариантов, которые могут влиять на функцию белков.
- Данные проекта используются не только в медицине, но и в антропологии, криминалистике и эволюционной биологии.
- Несмотря на завершение активной фазы, база данных продолжает обновляться и расширяться за счёт добавления новых образцов и улучшения алгоритмов аннотации.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →