Проект «1000 Genomes Project
1000 Genomes Project (Проект «1000 геномов») — международный исследовательский проект, начатый в 2008 году, целью которого было создание наиболее полного каталога генетических вариаций человека, включая однонуклеотидные полиморфизмы (SNP), структурные варианты (вставки, делеции, инверсии) и вариации числа копий (CNV). Проект стал одним из крупнейших в области геномики и предоставил открытый доступ к данным о геномах тысяч людей из разных популяций мира.
История
Проект был официально запущен в январе 2008 года как консорциум, объединивший исследовательские институты, университеты и геномные центры из Великобритании, США, Китая, Германии и других стран. Инициаторами выступили Wellcome Trust Sanger Institute (Великобритания), Национальный институт исследования генома человека (NHGRI, США) и Пекинский институт геномики (BGI, Китай). Основной задачей было преодоление ограничений предыдущих проектов, таких как «HapMap Project», которые фокусировались на SNP и не охватывали редкие варианты и структурные изменения.
Финансирование осуществлялось за счёт грантов от Wellcome Trust, Национальных институтов здравоохранения США (NIH) и других национальных фондов. Первая фаза проекта (2008–2010) включала секвенирование геномов 1092 человек из 14 популяций методом низкого покрытия (4–6×) и экзомного секвенирования. Вторая фаза (2010–2012) расширила выборку до 2504 человек из 26 популяций и повысила качество данных за счёт секвенирования с более высоким покрытием (7–10×). Финальный набор данных был опубликован в 2015 году в журнале Nature.
Методология
Сбор образцов
Образцы крови или тканей собирались у добровольцев, представляющих основные мировые популяции: африканцы (йоруба, лухья, масаи), европейцы (финны, британцы, итальянцы), азиаты (ханьцы, японцы, вьетнамцы), американцы (пуэрториканцы, колумбийцы) и другие. Для каждой популяции было отобрано от 50 до 200 образцов, чтобы обеспечить статистическую мощность для выявления как частых, так и редких вариантов.
Секвенирование
Использовались три платформы секвенирования нового поколения (NGS): Illumina (основная), Life Technologies (SOLiD) и 454 Life Sciences. Для каждого образца проводилось:
- Секвенирование всего генома (whole-genome sequencing, WGS) с низким покрытием (4–6×) для выявления большинства вариантов.
- Секвенирование экзома (whole-exome sequencing, WES) с высоким покрытием (50–100×) для точного анализа кодирующих участков.
- Генотипирование с помощью SNP-чипов (Illumina Omni 2.5M) для проверки и калибровки данных.
Анализ данных
Биоинформатическая обработка включала выравнивание прочтений на эталонный геном человека (GRCh37/hg19), выявление вариантов с помощью алгоритмов (GATK, SAMtools), фильтрацию ложноположительных результатов и аннотацию функциональных последствий. Для структурных вариантов использовались специализированные программы (BreakDancer, Pindel, CNVnator). Все данные были деидентифицированы и размещены в открытом доступе через порталы, такие как Ensembl, UCSC Genome Browser и dbSNP.
Результаты
Каталог вариаций
Проект выявил более 88 миллионов однонуклеотидных вариантов (SNV), 3,6 миллиона коротких инделов (вставок/делеций) и около 60 000 структурных вариантов (делеций, дупликаций, инверсий) среди 2504 участников. Из них около 8 миллионов вариантов были редкими (частота менее 0,5%) и ранее не известными. Каталог охватывает как частые полиморфизмы (например, SNP с частотой >5%), так и редкие мутации, которые могут быть причиной наследственных заболеваний.
Популяционная геномика
Анализ показал значительные различия в генетическом разнообразии между популяциями. Наибольшее разнообразие наблюдалось у африканских популяций (например, у йоруба — около 12 миллионов вариантов на геном), что соответствует теории африканского происхождения человека. Европейские и азиатские популяции имели меньшее разнообразие (около 8–9 миллионов вариантов на геном) из-за эффекта бутылочного горлышка при миграциях из Африки. Также были выявлены сигналы естественного отбора — например, в генах, связанных с пигментацией кожи (SLC24A5, MC1R), метаболизмом лактозы (LCT) и иммунным ответом (HLA).
Применение в медицине
Данные проекта стали основой для многих исследований в области медицинской генетики:
- Поиск генов заболеваний: Каталог редких вариантов помог идентифицировать мутации, ассоциированные с наследственными болезнями, такими как муковисцидоз, серповидноклеточная анемия и болезнь Гентингтона.
- Фармакогеномика: Выявлены варианты, влияющие на метаболизм лекарств (например, CYP2D6, CYP2C19), что используется для персонализированной терапии.
- Популяционная генетика: Данные применяются для оценки генетического риска в разных этнических группах, а также для изучения миграций и эволюции человека.
Критика и ограничения
Несмотря на масштаб, проект имел ряд ограничений:
- Неполное покрытие: Секвенирование с низким покрытием (4–6×) не позволяло надёжно выявлять редкие варианты с частотой менее 0,1% и структурные варианты малого размера.
- Этническая неравномерность: Хотя проект охватывал 26 популяций, выборка была смещена в сторону европейских и азиатских групп; африканские популяции были представлены лишь несколькими группами (йоруба, лухья, масаи), что не отражает всего разнообразия Африки.
- Отсутствие клинических данных: Участники были здоровыми добровольцами, поэтому проект не предоставлял информации о связи вариантов с конкретными заболеваниями.
- Этические вопросы: Сбор образцов в некоторых регионах (например, в Кении и Китае) вызывал дискуссии о согласии и конфиденциальности, особенно в контексте возможного использования данных для дискриминации.
Наследие
Проект «1000 Genomes» стал эталонным ресурсом для геномных исследований. Его данные используются в таких проектах, как «UK Biobank», «All of Us Research Program» (США) и «GenomeAsia 100K». В 2016 году проект был официально завершён, но его каталог продолжает обновляться и интегрироваться в международные базы данных (например, gnomAD, dbSNP). В России данные проекта применяются в исследованиях популяционной генетики (например, в работах Института общей генетики им. Н. И. Вавилова РАН) и в клинической генетике для интерпретации результатов секвенирования.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →