Контиг
Контиг — это непрерывная последовательность нуклеотидов (фрагмент ДНК или РНК), полученная в результате сборки генома из коротких прочтений (ридов) без разрывов. Контиг представляет собой консенсусную последовательность, собранную из перекрывающихся фрагментов, и является промежуточным звеном между отдельными прочтениями и полной хромосомой или геномом.
История возникновения термина
Термин «контиг» (от англ. contig — contiguous + sequence) был введён в 1988 году американским биоинформатиком Роджером Стаденом (Roger Staden) в контексте разработки методов сборки последовательностей ДНК. Изначально понятие использовалось для описания результата сборки фрагментов, полученных методом Сэнгера, где длина отдельных прочтений составляла 500–1000 пар оснований. С развитием технологий секвенирования нового поколения (NGS) в 2000-х годах контиги стали ключевым элементом алгоритмов de novo сборки, позволяющих восстанавливать геномы без эталонной последовательности.
Процесс формирования контигов
Сборка из ридов
Сборка контигов начинается с выравнивания коротких прочтений (ридов) длиной от 50 до 300 пар оснований (для NGS) или до 20 000 пар оснований (для технологий третьего поколения, таких как PacBio и Oxford Nanopore). Алгоритмы сборки ищут перекрытия между ридами, объединяя их в более длинные последовательности. Основные этапы:
- Построение графа перекрытий — на основе попарного сравнения всех ридов выявляются участки с идентичными или почти идентичными последовательностями.
- Укладка в контиги — риды, перекрывающиеся с высокой степенью достоверности, объединяются в контиг. При этом учитываются возможные ошибки секвенирования (замены, вставки, делеции).
- Коррекция ошибок — консенсусная последовательность контига уточняется путём многократного выравнивания ридов.
Факторы, влияющие на длину контигов
- Глубина покрытия (количество ридов, покрывающих каждый нуклеотид) — чем выше покрытие, тем точнее сборка.
- Повторяющиеся участки — длинные повторы (например, центромерные или теломерные области) затрудняют однозначное выравнивание, что приводит к разрывам контигов.
- Качество ридов — ошибки секвенирования и низкая точность (особенно в технологиях третьего поколения) могут создавать ложные перекрытия.
Классификация контигов
По длине
- Короткие контиги — менее 10 000 пар оснований (типичны для сборок на основе NGS с низким покрытием).
- Средние контиги — от 10 000 до 100 000 пар оснований.
- Длинные контиги — более 100 000 пар оснований (характерны для сборок с использованием длинных прочтений).
По происхождению
- Геномные контиги — последовательности, относящиеся к ядерному или митохондриальному геному.
- Метагеномные контиги — фрагменты, собранные из смеси ДНК разных организмов (например, из образцов почвы или кишечной микрофлоры). Такие контиги часто требуют дополнительной классификации (бинирования) для отнесения к конкретным таксонам.
Роль контигов в сборке генома
De novo сборка
При сборке генома без эталонной последовательности контиги служат основой для построения скаффолдов (scaffolds) — более крупных структур, которые объединяют контиги с учётом информации о парных прочтениях (mate-pair) или оптических картах. В идеале контиги должны покрывать всю хромосому, но на практике из-за повторов и гетерозиготности остаются разрывы.
Референсная сборка
При выравнивании на эталонный геном контиги используются для выявления структурных вариантов (вставок, делеций, инверсий) и сборки новых участков, отсутствующих в референсе.
Метрики качества контигов
Для оценки качества сборки генома используются следующие показатели:
- N50 — длина контига, при которой 50 % всего собранного генома содержится в контигах не короче этого значения. Чем выше N50, тем длиннее непрерывные участки сборки.
- L50 — минимальное количество контигов, составляющих 50 % генома.
- Общее количество контигов — чем меньше, тем лучше, так как это указывает на меньшее число разрывов.
- Максимальная длина контига — показатель, отражающий способность сборки покрывать длинные участки без повторов.
Применение контигов
Геномика
- Сборка геномов новых организмов — контиги являются первым этапом восстановления полной последовательности ДНК бактерий, архей, растений и животных.
- Исследование структурных вариаций — сравнение контигов здоровых и больных тканей помогает выявлять хромосомные перестройки, связанные с онкологическими заболеваниями.
Метагеномика
- Анализ микробных сообществ — контиги из метагеномных данных позволяют идентифицировать новые виды бактерий и вирусов, а также изучать их функциональные гены (например, устойчивость к антибиотикам).
Филогенетика
- Построение эволюционных деревьев — контиги консервативных участков генома (например, 16S рРНК) используются для классификации микроорганизмов.
Инструменты для работы с контигами
Программы сборки
- SPAdes (Россия, разработан в Лаборатории алгоритмической биологии СПбГУ) — популярный сборщик для бактериальных и метагеномных геномов.
- SOAPdenovo — сборщик, ориентированный на короткие риды от Illumina.
- Canu — программа для сборки длинных прочтений (PacBio, Oxford Nanopore).
- Flye — сборщик, специализирующийся на повторяющихся участках.
Инструменты анализа
- QUAST — программа для оценки качества сборки по метрикам N50, L50 и другим.
- Bandage — визуализатор графов сборки, позволяющий просматривать структуру контигов и выявлять разрывы.
Ограничения и проблемы
- Повторяющиеся элементы — длинные повторы (например, LINE-элементы у человека) часто приводят к фрагментации контигов, так как алгоритмы не могут однозначно определить их порядок.
- Гетерозиготность — у диплоидных организмов различия между аллелями могут быть ошибочно интерпретированы как разные участки, что создаёт ложные контиги.
- Ошибки секвенирования — в технологиях третьего поколения частота ошибок достигает 10–15 %, что требует дополнительной коррекции.
Перспективы развития
С развитием методов секвенирования длинных прочтений (PacBio HiFi, Oxford Nanopore с точностью Q20+) длина контигов в сборках приближается к длине целых хромосом. Например, в 2022 году была опубликована первая полная сборка генома человека (T2T-CHM13), где контиги покрывали все хромосомы без разрывов, включая центромерные и теломерные области. Это стало возможным благодаря комбинации длинных прочтений и методов оптического картирования.
Источники
- Staden R. A strategy of DNA sequencing employing computer programs // Nucleic Acids Research. — 1988. — Vol. 16, № 10. — P. 4491–4503.
- Miller J.R., Koren S., Sutton G. Assembly algorithms for next-generation sequencing data // Genomics. — 2010. — Vol. 95, № 6. — P. 315–327.
- Nurk S., Bankevich A., Antipov D. et al. Assembling single-cell genomes and mini-metagenomes from chimeric MDA products // Journal of Computational Biology. — 2013. — Vol. 20, № 10. — P. 714–737.
- Nurk S., Koren S., Rhie A. et al. The complete sequence of a human genome // Science. — 2022. — Vol. 376, № 6588. — P. 44–53.
- QUAST: quality assessment tool for genome assemblies // Bioinformatics. — 2013. — Vol. 29, № 8. — P. 1072–1075.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →