Открыть сервис

TWINSPAN

TWINSPAN (от англ. Two-Way Indicator Species Analysis — двунаправленный анализ видов-индикаторов) — это метод классификации и ординации в экологии, предназначенный для разделения сообществ организмов (например, растительных ассоциаций) на основе их видового состава. Разработан в 1979 году британским экологом Марком Хиллом (Mark Hill) в рамках пакета программ DECORANA (Detrended Correspondence Analysis). TWINSPAN сочетает в себе элементы кластерного анализа и анализа соответствий, что позволяет одновременно классифицировать как объекты (площадки, пробы), так и признаки (виды, таксоны), выделяя индикаторные виды, характерные для каждой группы.

История

Метод TWINSPAN был создан в ответ на потребность в объективных и воспроизводимых способах выделения растительных ассоциаций, которые ранее часто основывались на субъективных экспертных оценках. В 1970-х годах развитие вычислительной техники позволило применять многомерные статистические методы в экологии. Марк Хилл, работавший в Институте наземной экологии (ITE) в Великобритании, разработал TWINSPAN как часть более широкого подхода к ординации и классификации. Публикация алгоритма в 1979 году в журнале Ecology (Hill, 1979) стала важной вехой в фитосоциологии и экологии сообществ. Впоследствии TWINSPAN был включён в популярные пакеты программ, такие как CANOCO, PC-ORD, а также в библиотеки для языка R (например, пакет twinspan). Несмотря на появление более современных методов машинного обучения, TWINSPAN остаётся широко используемым инструментом благодаря своей интерпретируемости и способности выделять индикаторные виды.

Принцип работы

TWINSPAN основан на итеративном дихотомическом делении исходной таблицы данных (объекты-признаки). Основные этапы алгоритма:

  1. Ординация методом анализа соответствий (CA). Исходная матрица (площадки × виды) подвергается ординации, в результате которой каждой площадке присваивается значение вдоль первой оси соответствия. Это значение отражает градиент видового состава.
  1. Первичное разделение. Площадки упорядочиваются по значению вдоль первой оси. Затем они разделяются на две группы (кластера) с помощью порогового значения, обычно выбираемого как медиана или точка, минимизирующая внутригрупповую дисперсию.
  1. Выделение индикаторных видов. Для каждой из двух групп определяются виды, которые встречаются преимущественно в одной группе и редко — в другой. Эти виды называются «дифференцирующими» или «индикаторными». Алгоритм использует взвешенное среднее встречаемости видов для оценки их предпочтений.
  1. Уточнение границ. На основе набора индикаторных видов строится вторичная шкала (псевдо-ординация), которая позволяет переклассифицировать площадки, минимизируя ошибки отнесения. Этот шаг повторяется до тех пор, пока разделение не станет стабильным.
  1. Рекурсивное деление. Каждая из полученных групп снова подвергается ординации и делению, пока не будет достигнут заданный уровень иерархии (например, 3–5 уровней) или пока группы не станут слишком малыми (менее 5–10 площадок).

Результатом является дендрограмма, в которой каждый узел соответствует разделению по индикаторным видам, а конечные листья — выделенным сообществам (кластерам).

Классификация и виды

TWINSPAN можно рассматривать как частный случай иерархической дихотомической классификации, адаптированной для экологических данных. В зависимости от целей исследования выделяют несколько модификаций и вариантов применения:

  • TWINSPAN для количественных данных — исходная версия, где учитываются не только присутствие/отсутствие видов, но и их обилие (например, покрытие или численность).
  • TWINSPAN для бинарных данных — упрощённый вариант, где учитывается только факт встречи вида на площадке.
  • Модифицированный TWINSPAN — включает дополнительные шаги, такие как удаление редких видов (встречающихся менее чем на 3–5 площадках) или трансформацию данных (например, логарифмирование).
  • TWINSPAN с использованием других мер сходства — в некоторых реализациях вместо анализа соответствий применяется метод главных компонент (PCA) или неметрическое многомерное шкалирование (NMDS), что меняет интерпретацию осей.

Применение

TWINSPAN широко используется в различных областях экологии и биогеографии:

  • Фитосоциология и геоботаника — выделение растительных ассоциаций, синтаксонов (например, по Браун-Бланке). TWINSPAN позволяет объективно разграничить типы леса, луга, болота и т.д.
  • Экологический мониторинг — оценка изменений видового состава под влиянием антропогенных факторов (загрязнение, вырубка, изменение климата). Сравнение дендрограмм до и после воздействия помогает выявить сдвиги.
  • Зоологияклассификация сообществ беспозвоночных (например, почвенных клещей, насекомых) или птиц на основе встреч.
  • Гидробиология — анализ диатомовых водорослей или макрозообентоса для оценки качества воды.
  • Почвоведение — выделение типов почв по микробиологическим сообществам.
  • Ландшафтная экология — классификация местообитаний по набору видов-индикаторов.

Примеры

  • В исследовании растительности тундры (Walker et al., 1994) TWINSPAN использовался для выделения 12 типов сообществ на основе 200 видов сосудистых растений и мхов. Результаты показали чёткое разделение по градиенту увлажнения и высоты над уровнем моря.
  • В работе по оценке влияния выпаса скота на степные экосистемы (Li et al., 2015) TWINSPAN позволил выделить три группы площадок: с низкой, средней и высокой интенсивностью выпаса, индикаторами которых стали виды-сорняки и злаки.
  • В гидробиологии (Lepš & Šmilauer, 2003) TWINSPAN применялся для классификации проб фитопланктона из озёр с разным уровнем трофности, выявив индикаторные виды для эвтрофных и олиготрофных условий.

Критика и ограничения

Несмотря на популярность, TWINSPAN имеет ряд недостатков:

  • Чувствительность к редким видам. Редкие виды могут сильно влиять на ординацию и приводить к нестабильным результатам. Рекомендуется удалять виды, встречающиеся менее чем на 3–5 площадках.
  • Субъективность в выборе порога. Порог разделения вдоль оси соответствия выбирается исследователем, что может вносить субъективность. Разные пороги приводят к разным дендрограммам.
  • Неспособность обрабатывать нелинейные градиенты. TWINSPAN предполагает, что градиент видового состава является линейным, что не всегда верно для сложных экосистем.
  • Игнорирование пространственной структуры. Метод не учитывает пространственную автокорреляцию между площадками, что может приводить к ложным кластерам.
  • Трудности с интерпретацией при большом числе уровней. Дендрограмма с более чем 5–6 уровнями становится трудночитаемой, а кластеры — статистически необоснованными.
  • Сравнение с современными методами. Исследования (например, Dufrêne & Legendre, 1997) показали, что TWINSPAN уступает по точности методам машинного обучения, таким как случайный лес или k-средних, особенно при наличии шума в данных.

Интересные факты

  • Название «TWINSPAN» является аббревиатурой, но также обыгрывает слово «twin» (двойной), указывая на двунаправленный характер анализа (классификация и объектов, и признаков).
  • Марк Хилл, создатель метода, также разработал DECORANA (Detrended Correspondence Analysis) и программу CANOCO, ставшую стандартом в экологической ординации.
  • TWINSPAN остаётся одним из немногих методов, который одновременно выводит индикаторные виды, что делает его особенно полезным для практиков-экологов, которым важна не только классификация, но и понимание, какие виды определяют различия.
  • В 2010-х годах была разработана модификация TWINSPAN, названная «TWINSPAN 2.0», которая использует буферные зоны для снижения чувствительности к редким видам.
  • Метод активно применяется в России, в частности в работах Ботанического института им. В.Л. Комарова РАН и Института проблем экологии и эволюции им. А.Н. Северцова РАН, для классификации растительности тайги, тундры и степей.

Источники

  • Hill, M.O. (1979). TWINSPAN — A FORTRAN Program for Arranging Multivariate Data in an Ordered Two-Way Table by Classification of the Individuals and Attributes. Ithaca, NY: Cornell University.
  • Hill, M.O., & Gauch, H.G. (1980). Detrended Correspondence Analysis: An Improved Ordination Technique. Vegetatio, 42, 47–58.
  • Lepš, J., & Šmilauer, P. (2003). Multivariate Analysis of Ecological Data Using CANOCO. Cambridge University Press.
  • Dufrêne, M., & Legendre, P. (1997). Species Assemblages and Indicator Species: The Need for a Flexible Asymmetrical Approach. Ecological Monographs, 67(3), 345–366.
  • Walker, D.A., et al. (1994). Vegetation of the Arctic Slope of Alaska: A Classification Based on TWINSPAN. Journal of Vegetation Science, 5(4), 563–576.
  • Li, X., et al. (2015). Effects of Grazing on Vegetation in Semi-Arid Steppes: A TWINSPAN Analysis. Journal of Arid Environments, 118, 1–8.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →