Сборка генома
Сборка генома — это процесс восстановления полной или частичной последовательности нуклеотидов в молекуле ДНК организма на основе коротких фрагментов, полученных в результате секвенирования. Сборка является ключевым этапом в биоинформатике и геномике, позволяющим перейти от набора хаотичных «прочтений» (ридов) к целостной структуре генома, которая затем используется для аннотации генов, поиска мутаций и сравнительного анализа.
История
Ранние методы
Первые сборки геномов выполнялись вручную или с помощью простых алгоритмов, таких как метод «наложения фрагментов» (overlap-layout-consensus, OLC). В 1995 году был опубликован первый полный геном бактерии Haemophilus influenzae, собранный с использованием секвенирования по Сэнгеру. Этот метод требовал длинных ридов (до 1000 нуклеотидов) и высокой точности, но был трудоёмким и дорогим.
Эра высокопроизводительного секвенирования
С появлением технологий секвенирования нового поколения (NGS) в середине 2000-х годов (например, Illumina, Roche 454) объём данных резко возрос, а длина ридов уменьшилась до 50–300 нуклеотидов. Это потребовало разработки новых алгоритмов, основанных на графах де Брёйна (de Bruijn graphs), которые эффективно обрабатывают короткие риды и позволяют собирать геномы бактерий и вирусов за несколько часов.
Современные подходы
С 2010-х годов стали доступны технологии секвенирования третьего поколения (PacBio, Oxford Nanopore), генерирующие длинные риды (до десятков тысяч нуклеотидов). Это упростило сборку сложных участков генома, таких как повторяющиеся последовательности и центромеры. В 2022 году международный проект Telomere-to-Telomere (T2T) впервые представил полную сборку человеческого генома без пробелов, включая все центромеры и теломеры.
Типы сборки
De novo сборка
Сборка генома без использования референсной последовательности. Применяется для организмов, геном которых ранее не был секвенирован, или для выявления новых структурных вариантов. Алгоритмы de novo сборки (например, SPAdes, Canu, Flye) строят графы, находят контиги (непрерывные участки) и затем объединяют их в скаффолды.
Референсная сборка
Сборка путём выравнивания ридов на известную референсную последовательность (например, геном человека). Этот метод быстрее и требует меньше вычислительных ресурсов, но не позволяет обнаружить крупные структурные вариации, отсутствующие в референсе. Используется в клинической диагностике и популяционной генетике.
Гибридная сборка
Комбинация коротких и длинных ридов: короткие обеспечивают высокую точность, длинные — разрешение повторяющихся участков. Примеры инструментов: MaSuRCA, Unicycler, hybridSPAdes. Гибридный подход стал стандартом для сборки сложных геномов эукариот.
Этапы сборки
Предобработка данных
Удаление адаптеров, фильтрация низкокачественных ридов, коррекция ошибок секвенирования. Для этого используются программы FastQC, Trimmomatic, Cutadapt. Качество исходных данных напрямую влияет на точность сборки.
Построение графа
Для коротких ридов строится граф де Брёйна, где вершины — это k-меры (подпоследовательности длины k), а рёбра — переходы между ними. Для длинных ридов применяется граф наложения (overlap graph), где вершины — риды, а рёбра — их перекрытия.
Сборка контигов
Из графа извлекаются пути, соответствующие непрерывным последовательностям. Узкие места (повторы, ошибки) приводят к разрывам. Контиги — это первый результат сборки, их длина варьируется от нескольких килобаз до мегабаз.
Скаффолдинг
Контиги упорядочиваются и ориентируются с помощью парных концов (mate-pairs) или длинных ридов. Скаффолды содержат пробелы (gap), которые позже закрываются дополнительным секвенированием или алгоритмами заполнения.
Закрытие пробелов
Специальные инструменты (GapFiller, Sealer) используют неиспользованные риды для заполнения неизвестных участков. Для сложных геномов этот этап может занимать до 50% времени сборки.
Инструменты и программное обеспечение
Для коротких ридов
- SPAdes — один из самых популярных сборщиков для бактерий и небольших эукариот. Поддерживает гибридный режим.
- Velvet — классический сборщик на основе графа де Брёйна, оптимизирован для геномов среднего размера.
- ABySS — разработан для параллельной сборки на кластерах, используется для крупных геномов.
Для длинных ридов
- Canu — сборщик для PacBio и Oxford Nanopore, включает этапы коррекции и сборки.
- Flye — быстрый сборщик, специально созданный для длинных ридов, не требует предварительной коррекции.
- Miniasm — лёгкий инструмент для быстрой сборки бактериальных геномов.
Для гибридной сборки
- Unicycler — популярный сборщик для бактерий, комбинирующий короткие и длинные риды.
- MaSuRCA — универсальный инструмент, поддерживающий различные типы данных.
Оценка качества сборки
Метрики
- N50 — длина контига, при которой 50% генома собрано в контиги не меньшей длины. Чем выше N50, тем лучше.
- L50 — минимальное количество контигов, покрывающих 50% генома.
- Полнота — оценивается с помощью BUSCO (Benchmarking Universal Single-Copy Orthologs), который проверяет наличие консервативных генов.
- Количество пробелов — чем меньше, тем выше качество.
Валидация
Сравнение с референсным геномом (если доступен) с помощью MUMmer или QUAST. Проверка на химерные контиги (артефакты, объединяющие разные участки генома) с помощью анализа покрытия.
Применение
Фундаментальная наука
Сборка геномов позволяет изучать эволюцию, филогению и генетическое разнообразие видов. Например, сборка генома неандертальца (2010 год) выявила гибридизацию с современными людьми.
Медицина
В клинической генетике сборка используется для поиска мутаций, связанных с наследственными заболеваниями, и для персонализированной терапии. Проект «1000 геномов» (2008–2015) собрал данные о вариациях в популяциях человека.
Сельское хозяйство
Сборка геномов культурных растений (пшеница, рис, кукуруза) и домашних животных помогает в селекции и устойчивости к болезням. Например, сборка генома пшеницы (2018 год) заняла более 10 лет из-за его большого размера (17 Гб) и полиплоидности.
Микробиология
Сборка геномов бактерий и вирусов используется для идентификации патогенов, отслеживания эпидемий и разработки вакцин. Во время пандемии COVID-19 (2020–2023) сборка генома SARS-CoV-2 была выполнена за несколько дней.
Сложности и ограничения
Повторяющиеся последовательности
Длинные повторы (например, в центромерах и теломерах) не могут быть однозначно собраны короткими ридами. Даже длинные риды не всегда разрешают сложные структуры, такие как тандемные повторы.
Полиплоидность
У полиплоидных организмов (например, пшеница, картофель) несколько копий генома могут быть ошибочно объединены в один контиг. Для их сборки требуются специальные алгоритмы (например, hifiasm).
Ошибки секвенирования
Высокий уровень ошибок в длинных ридах (до 10–15% для Oxford Nanopore) требует коррекции, что увеличивает время и ресурсы. Гибридные подходы частично решают эту проблему.
Вычислительные ресурсы
Сборка генома человека (3,2 Гб) может потребовать до 1 ТБ оперативной памяти и нескольких недель работы на кластере. Для больших геномов (например, сосны, 20 Гб) требуются суперкомпьютеры.
Перспективы
Развитие технологий секвенирования (например, считывание одной молекулы без амплификации) и алгоритмов машинного обучения (например, нейросетевые корректоры) позволяет собирать геномы всё быстрее и точнее. Проект «Пангеном человека» (2023) включает сборку геномов из разных популяций, что улучшает репрезентативность данных. В будущем возможна сборка генома в реальном времени для диагностики инфекций и мониторинга мутаций.
Источники
- Baker, M. (2012). De novo genome assembly: what every biologist should know. Nature Methods.
- Koren, S., et al. (2017). Canu: scalable and accurate long-read assembly via adaptive k-mer weighting and repeat separation. Genome Research.
- Nurk, S., et al. (2022). The complete sequence of a human genome. Science.
- Simpson, J. T., & Pop, M. (2015). The theory and practice of genome sequence assembly. Annual Review of Genomics and Human Genetics.
- Wick, R. R., et al. (2017). Unicycler: resolving bacterial genome assemblies from short and long sequencing reads. PLoS Computational Biology.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →