Открыть сервис

Филогенетический анализ: построение эволюционных деревьев

Филогенетический анализ — это совокупность методов и вычислительных алгоритмов, предназначенных для реконструкции эволюционной истории организмов, генов или белков и представления её в виде филогенетического дерева (кладограммы). Данный раздел биоинформатики и эволюционной биологии опирается на сравнение гомологичных признаков (морфологических, молекулярных, поведенческих) и позволяет устанавливать родственные связи между таксонами, оценивать время расхождения линий и изучать процессы видообразования.

История развития

Основы филогенетики были заложены в XIX веке Чарльзом Дарвином, который впервые представил эволюцию как процесс ветвления родословных линий. Однако формализованные методы построения деревьев появились лишь в середине XX века. В 1950-х годах немецкий энтомолог Вилли Хенниг разработал принципы кладистики — подхода, при котором группы организмов выделяются на основе общих производных признаков (синапоморфий). С развитием молекулярной биологии в 1960–1970-х годах (секвенирование белков и нуклеиновых кислот) возникла молекулярная филогенетика. Ключевыми вехами стали разработка методов максимальной экономии (парсимонии) и дистанционных алгоритмов, а в 1980-х годах — появление вероятностных подходов (максимального правдоподобия) и первых программных пакетов (PHYLIP, PAUP). С 2000-х годов доминирующее положение заняли байесовские методы и анализ больших геномных данных.

Исходные данные и гомология

Входными данными для анализа служат выровненные последовательности ДНК, РНК или аминокислот, а также матрицы морфологических признаков. Критически важным условием является установление гомологии — соответствия сравниваемых позиций, унаследованных от общего предка, а не возникших независимо (конвергенция). Для выравнивания последовательностей применяются алгоритмы, основанные на динамическом программировании (Needleman-Wunsch, Smith-Waterman) и эвристические программы (MUSCLE, MAFFT, Clustal Omega). Качество выравнивания напрямую влияет на достоверность последующей реконструкции.

Методы построения филогенетических деревьев

Дистанционные методы

Дистанционные методы основаны на вычислении попарных генетических расстояний между последовательностями с последующей кластеризацией. Наиболее распространённые алгоритмы — UPGMA (метод невзвешенного попарного среднего) и Neighbor-Joining (метод ближайшего соседа). Эти методы быстры и пригодны для больших выборок, однако теряют информацию о конкретных характерах замен и могут давать ошибки при неравных скоростях эволюции в разных линиях.

Методы, основанные на признаках

К этой группе относятся методы максимальной экономии (maximum parsimony) и максимального правдоподобия (maximum likelihood). Метод максимальной экономии ищет дерево, требующее минимального числа эволюционных изменений для объяснения наблюдаемых данных. Метод максимального правдоподобия использует явные модели нуклеотидных или аминокислотных замен (например, модели Jukes-Cantor, Kimura-2-parameter, GTR) и оценивает вероятность наблюдаемых данных при заданном дереве, выбирая топологию с наибольшей вероятностью.

Байесовский анализ

Байесовские методы (программы MrBayes, BEAST) оценивают апостериорное распределение деревьев с использованием цепей Маркова Монте-Карло (MCMC). Они позволяют интегрировать неопределённость параметров модели и дают апостериорные вероятности для каждой клады, что делает их особенно популярными в современных исследованиях.

Оценка достоверности

Для проверки устойчивости полученной топологии применяются статистические процедуры. Наиболее распространённый метод — бутстрэп (bootstrap): многократная случайная выборка позиций выравнивания с повторной реконструкцией дерева. Высокие значения бутстрэпа (обычно >70–80%) свидетельствуют о надёжности клады. В байесовском анализе аналогичную роль выполняют апостериорные вероятности (значения >0,95 считаются значимыми).

Применение

Филогенетический анализ широко используется в систематике для уточнения классификации организмов, в молекулярной эпидемиологии для отслеживания путей распространения патогенов (например, вирусов гриппа и SARS-CoV-2), в сравнительной геномике для изучения эволюции генов и геномов, а также в филогеографии для реконструкции истории популяций. В биотехнологии филогенетические деревья помогают предсказывать функцию неизученных белков по их родству с охарактеризованными гомологами.

Ограничения и проблемы

Основные трудности связаны с неравномерностью темпов эволюции, насыщением замен (когда позиции меняются многократно и информация стирается), горизонтальным переносом генов у прокариот и неполным сортированием линий (incomplete lineage sorting). Кроме того, выбор модели эволюции и метода анализа может влиять на результат, поэтому в современных исследованиях принято сравнивать несколько подходов и оценивать конгруэнтность полученных деревьев.

Программное обеспечение

Для проведения филогенетического анализа разработано множество программных пакетов. К наиболее известным относятся MEGA (интегрированная среда с графическим интерфейсом), PHYLIP, PAUP*, RAxML и IQ-TREE (для максимального правдоподобия), MrBayes и BEAST (для байесовского анализа), а также FigTree и Archaeopteryx для визуализации деревьев. Большинство программ доступны в виде свободного программного обеспечения и поддерживают параллельные вычисления для обработки больших наборов данных.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →