Открыть сервис

Контиг

Контиг — это непрерывная последовательность нуклеотидов (фрагмент ДНК или РНК), полученная в результате сборки генома из коротких прочтений (ридов) без разрывов. Контиг представляет собой консенсусную последовательность, собранную из перекрывающихся фрагментов, и является промежуточным звеном между отдельными прочтениями и полной хромосомой или геномом.

История возникновения термина

Термин «контиг» (от англ. contigcontiguous + sequence) был введён в 1988 году американским биоинформатиком Роджером Стаденом (Roger Staden) в контексте разработки методов сборки последовательностей ДНК. Изначально понятие использовалось для описания результата сборки фрагментов, полученных методом Сэнгера, где длина отдельных прочтений составляла 500–1000 пар оснований. С развитием технологий секвенирования нового поколения (NGS) в 2000-х годах контиги стали ключевым элементом алгоритмов de novo сборки, позволяющих восстанавливать геномы без эталонной последовательности.

Процесс формирования контигов

Сборка из ридов

Сборка контигов начинается с выравнивания коротких прочтений (ридов) длиной от 50 до 300 пар оснований (для NGS) или до 20 000 пар оснований (для технологий третьего поколения, таких как PacBio и Oxford Nanopore). Алгоритмы сборки ищут перекрытия между ридами, объединяя их в более длинные последовательности. Основные этапы:

  1. Построение графа перекрытий — на основе попарного сравнения всех ридов выявляются участки с идентичными или почти идентичными последовательностями.
  2. Укладка в контиги — риды, перекрывающиеся с высокой степенью достоверности, объединяются в контиг. При этом учитываются возможные ошибки секвенирования (замены, вставки, делеции).
  3. Коррекция ошибок — консенсусная последовательность контига уточняется путём многократного выравнивания ридов.

Факторы, влияющие на длину контигов

  • Глубина покрытия (количество ридов, покрывающих каждый нуклеотид) — чем выше покрытие, тем точнее сборка.
  • Повторяющиеся участки — длинные повторы (например, центромерные или теломерные области) затрудняют однозначное выравнивание, что приводит к разрывам контигов.
  • Качество ридов — ошибки секвенирования и низкая точность (особенно в технологиях третьего поколения) могут создавать ложные перекрытия.

Классификация контигов

По длине

  • Короткие контиги — менее 10 000 пар оснований (типичны для сборок на основе NGS с низким покрытием).
  • Средние контиги — от 10 000 до 100 000 пар оснований.
  • Длинные контиги — более 100 000 пар оснований (характерны для сборок с использованием длинных прочтений).

По происхождению

  • Геномные контиги — последовательности, относящиеся к ядерному или митохондриальному геному.
  • Метагеномные контиги — фрагменты, собранные из смеси ДНК разных организмов (например, из образцов почвы или кишечной микрофлоры). Такие контиги часто требуют дополнительной классификации (бинирования) для отнесения к конкретным таксонам.

Роль контигов в сборке генома

De novo сборка

При сборке генома без эталонной последовательности контиги служат основой для построения скаффолдов (scaffolds) — более крупных структур, которые объединяют контиги с учётом информации о парных прочтениях (mate-pair) или оптических картах. В идеале контиги должны покрывать всю хромосому, но на практике из-за повторов и гетерозиготности остаются разрывы.

Референсная сборка

При выравнивании на эталонный геном контиги используются для выявления структурных вариантов (вставок, делеций, инверсий) и сборки новых участков, отсутствующих в референсе.

Метрики качества контигов

Для оценки качества сборки генома используются следующие показатели:

  • N50 — длина контига, при которой 50 % всего собранного генома содержится в контигах не короче этого значения. Чем выше N50, тем длиннее непрерывные участки сборки.
  • L50 — минимальное количество контигов, составляющих 50 % генома.
  • Общее количество контигов — чем меньше, тем лучше, так как это указывает на меньшее число разрывов.
  • Максимальная длина контига — показатель, отражающий способность сборки покрывать длинные участки без повторов.

Применение контигов

Геномика

  • Сборка геномов новых организмов — контиги являются первым этапом восстановления полной последовательности ДНК бактерий, архей, растений и животных.
  • Исследование структурных вариаций — сравнение контигов здоровых и больных тканей помогает выявлять хромосомные перестройки, связанные с онкологическими заболеваниями.

Метагеномика

  • Анализ микробных сообществ — контиги из метагеномных данных позволяют идентифицировать новые виды бактерий и вирусов, а также изучать их функциональные гены (например, устойчивость к антибиотикам).

Филогенетика

  • Построение эволюционных деревьев — контиги консервативных участков генома (например, 16S рРНК) используются для классификации микроорганизмов.

Инструменты для работы с контигами

Программы сборки

  • SPAdes (Россия, разработан в Лаборатории алгоритмической биологии СПбГУ) — популярный сборщик для бактериальных и метагеномных геномов.
  • SOAPdenovo — сборщик, ориентированный на короткие риды от Illumina.
  • Canu — программа для сборки длинных прочтений (PacBio, Oxford Nanopore).
  • Flye — сборщик, специализирующийся на повторяющихся участках.

Инструменты анализа

  • QUAST — программа для оценки качества сборки по метрикам N50, L50 и другим.
  • Bandage — визуализатор графов сборки, позволяющий просматривать структуру контигов и выявлять разрывы.

Ограничения и проблемы

  • Повторяющиеся элементы — длинные повторы (например, LINE-элементы у человека) часто приводят к фрагментации контигов, так как алгоритмы не могут однозначно определить их порядок.
  • Гетерозиготность — у диплоидных организмов различия между аллелями могут быть ошибочно интерпретированы как разные участки, что создаёт ложные контиги.
  • Ошибки секвенирования — в технологиях третьего поколения частота ошибок достигает 10–15 %, что требует дополнительной коррекции.

Перспективы развития

С развитием методов секвенирования длинных прочтений (PacBio HiFi, Oxford Nanopore с точностью Q20+) длина контигов в сборках приближается к длине целых хромосом. Например, в 2022 году была опубликована первая полная сборка генома человека (T2T-CHM13), где контиги покрывали все хромосомы без разрывов, включая центромерные и теломерные области. Это стало возможным благодаря комбинации длинных прочтений и методов оптического картирования.

Источники

  1. Staden R. A strategy of DNA sequencing employing computer programs // Nucleic Acids Research. — 1988. — Vol. 16, № 10. — P. 4491–4503.
  2. Miller J.R., Koren S., Sutton G. Assembly algorithms for next-generation sequencing data // Genomics. — 2010. — Vol. 95, № 6. — P. 315–327.
  3. Nurk S., Bankevich A., Antipov D. et al. Assembling single-cell genomes and mini-metagenomes from chimeric MDA products // Journal of Computational Biology. — 2013. — Vol. 20, № 10. — P. 714–737.
  4. Nurk S., Koren S., Rhie A. et al. The complete sequence of a human genome // Science. — 2022. — Vol. 376, № 6588. — P. 44–53.
  5. QUAST: quality assessment tool for genome assemblies // Bioinformatics. — 2013. — Vol. 29, № 8. — P. 1072–1075.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →