Открыть сервис

Лог-ранговый тест

Лог-ранговый тест (англ. log-rank test, также известный как критерий Мантеля — Кокса) — это непараметрический статистический критерий, используемый для сравнения распределений времени до наступления события в двух или более независимых группах. Он относится к методам анализа выживаемости (survival analysis) и применяется в тех случаях, когда данные содержат цензурированные наблюдения — то есть для части объектов момент наступления события не зафиксирован (например, пациент выбыл из исследования или не дожил до его окончания). Лог-ранговый тест проверяет нулевую гипотезу о том, что функции выживаемости (или интенсивности отказов) во всех сравниваемых группах идентичны. Тест не предполагает знания конкретного закона распределения времени до события, что делает его широко применимым в медицине, биологии, инженерии и демографии.

История

Метод был разработан в 1950-х — 1960-х годах. В 1958 году американский эпидемиолог Натан Мантель предложил подход для анализа таблиц сопряжённости с учётом времени наблюдения. В 1966 году британский статистик Дэвид Кокс (впоследствии автор регрессионной модели пропорциональных рисков) формализовал критерий на основе логарифмического рангового подхода. В 1972 году Кокс опубликовал работу, в которой лог-ранговый тест был представлен как частный случай модели пропорциональных рисков. С тех пор тест стал стандартным инструментом в клинических испытаниях, особенно при сравнении эффективности лечения в онкологии.

Основные понятия

Функция выживаемости

Функция выживаемости \( S(t) \) определяет вероятность того, что объект (например, пациент) не испытает события (например, смерти) к моменту времени \( t \). Лог-ранговый тест не требует оценки этой функции, но использует данные о порядке наступления событий.

Цензурирование

Цензурированные данные — это наблюдения, для которых точное время события неизвестно. Причины: потеря контакта, окончание исследования до наступления события, отказ от участия. Лог-ранговый тест корректно учитывает цензурирование, предполагая, что механизм цензурирования не зависит от времени до события (неинформативное цензурирование).

Интенсивность отказов (hazard)

Интенсивность отказов \( h(t) \) — это мгновенная вероятность наступления события в момент \( t \) при условии, что до этого момента событие не наступило. Лог-ранговый тест наиболее чувствителен к различиям в интенсивностях, когда отношение рисков (hazard ratio) между группами постоянно во времени (пропорциональные риски).

Математическая формулировка

Пусть имеется \( k \) групп (\( k \geq 2 \)). Для каждой группы \( i \) (\( i = 1, \dots, k \)) наблюдаются времена до события или цензурирования. Обозначим:

  • \( t_1 < t_2 < \dots < t_m \) — упорядоченные моменты времени, в которых произошли события (хотя бы в одной группе);
  • \( d_{ij} \) — число событий в группе \( i \) в момент \( t_j \);
  • \( n_{ij} \) — число объектов в группе \( i \), которые находятся под наблюдением непосредственно перед моментом \( t_j \) (риск-набор).

Для каждого момента \( t_j \) строится таблица сопряжённости \( 2 \times k \), где строки — «событие произошло» / «событие не произошло», а столбцы — группы. Лог-ранговый тест вычисляет наблюдаемое число событий в каждой группе \( O_i = \sum_{j} d_{ij} \) и ожидаемое число событий \( E_i = \sum_{j} \frac{n_{ij} \cdot d_{\cdot j}}{n_{\cdot j}} \), где \( d_{\cdot j} = \sum_i d_{ij} \) — общее число событий в момент \( t_j \), \( n_{\cdot j} = \sum_i n_{ij} \) — общий размер риск-набора.

Статистика теста имеет вид: \[ \chi^2 = \sum_{i=1}^{k} \frac{(O_i - E_i)^2}{E_i} \] При справедливости нулевой гипотезы эта статистика асимптотически распределена как \( \chi^2 \) с \( k-1 \) степенями свободы. Для двух групп (\( k=2 \)) часто используется альтернативная форма: \[ Z = \frac{O_1 - E_1}{\sqrt{\text{Var}(O_1 - E_1)}}, \] где \( Z \) приближённо имеет стандартное нормальное распределение.

Предположения и ограничения

Пропорциональность рисков

Лог-ранговый тест имеет наибольшую мощность, когда отношение интенсивностей отказов между группами постоянно во времени. Если риски пересекаются (например, в одной группе интенсивность сначала выше, а затем ниже), тест может не выявить значимых различий, даже если функции выживаемости различаются. В таких случаях рекомендуется использовать тесты, учитывающие временную зависимость (например, тест Пето или тест на основе взвешенных рангов).

Независимость наблюдений

Наблюдения в разных группах должны быть независимыми. Внутри группы объекты также считаются независимыми.

Цензурирование

Предполагается неинформативное цензурирование: момент цензурирования не зависит от вероятности наступления события. Если цензурирование связано с прогнозом (например, пациенты с более тяжёлым состоянием чаще выбывают), результаты могут быть смещены.

Размер выборки

Для асимптотической аппроксимации распределения статистики требуется достаточное количество событий (обычно не менее 10–20 событий на группу). При малом числе событий или малых группах рекомендуется использовать точные методы или симуляции.

Применение

Медицина и клинические испытания

Лог-ранговый тест является основным инструментом для сравнения выживаемости пациентов в клинических исследованиях. Например, при сравнении эффективности двух методов лечения рака (химиотерапия vs. таргетная терапия) тест позволяет определить, есть ли статистически значимое различие в продолжительности жизни. В таких исследованиях часто строят кривые выживаемости по методу Каплана — Мейера и накладывают на них результаты лог-рангового теста.

Биология и экология

В биологии тест применяется для анализа времени до гибели организмов в экспериментах с токсикантами, для сравнения продолжительности жизни разных генотипов или для оценки времени до прорастания семян в разных условиях.

Инженерия и надёжность

В технике лог-ранговый тест используется для сравнения времени до отказа различных типов оборудования, материалов или конструкций. Например, при испытаниях на долговечность двух партий подшипников.

Демография и социология

В демографии — для сравнения продолжительности жизни в разных популяциях или когортах. В социологии — для анализа времени до наступления события (например, время до повторного трудоустройства после потери работы).

Связанные методы

Тест Пето

Тест Пето (Peto test) — модификация лог-рангового теста, которая придаёт больший вес ранним событиям. Он менее чувствителен к нарушениям пропорциональности рисков в поздние периоды.

Тест Гехана — Бреслоу

Тест Гехана — Бреслоу (Gehan-Breslow test) использует взвешивание по числу объектов в риск-наборе, что делает его более чувствительным к различиям в ранние моменты времени.

Регрессия Кокса

Модель пропорциональных рисков Кокса (Cox proportional hazards model) позволяет оценивать влияние нескольких ковариат на время до события. Лог-ранговый тест является частным случаем этой модели для одной категориальной переменной.

Тест Флеминга — Харрингтона

Семейство тестов Флеминга — Харрингтона (Fleming-Harrington test) с параметрами \( p, q \) позволяет гибко настраивать вес, придаваемый различным временным отрезкам. При \( p = 0, q = 0 \) тест совпадает с лог-ранговым.

Реализация в программном обеспечении

Лог-ранговый тест реализован во всех основных статистических пакетах:

  • R: функция survdiff из пакета survival (формула Surv(time, event) ~ group).
  • Python: функция logrank_test из библиотеки lifelines или scipy.stats.logrank.
  • SAS: процедура LIFETEST с опцией test=logrank.
  • SPSS: модуль «Анализ выживаемости» (Kaplan-Meier) с опцией сравнения групп.
  • Stata: команда sts test с опцией logrank.

Критика и альтернативы

Основная критика лог-рангового теста связана с его зависимостью от предположения о пропорциональности рисков. При пересекающихся кривых выживаемости тест может давать ложные отрицательные результаты. В таких случаях исследователи рекомендуют:

  • использовать тесты, взвешивающие разные временные отрезки (например, тест Флеминга — Харрингтона);
  • применять непараметрические методы, не требующие пропорциональности, такие как тест Колмогорова — Смирнова для выживаемости;
  • строить доверительные интервалы для разности функций выживаемости.

Также отмечается, что при множественных сравнениях (более двух групп) необходимо корректировать уровень значимости (например, поправка Бонферрони или метод Холма).

Источники

  1. Cox D.R. (1972). «Regression Models and Life-Tables». Journal of the Royal Statistical Society. Series B, 34(2), 187–220.
  2. Mantel N. (1966). «Evaluation of survival data and two new rank order statistics arising in its consideration». Cancer Chemotherapy Reports, 50(3), 163–170.
  3. Peto R., Peto J. (1972). «Asymptotically efficient rank invariant test procedures». Journal of the Royal Statistical Society. Series A, 135(2), 185–207.
  4. Klein J.P., Moeschberger M.L. (2003). «Survival Analysis: Techniques for Censored and Truncated Data». 2nd ed. Springer.
  5. Therneau T.M., Grambsch P.M. (2000). «Modeling Survival Data: Extending the Cox Model». Springer.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →