Открыть сервис

Ретестовая надёжность

Ретестовая надёжность — это один из основных методов оценки надёжности психологического, педагогического или социологического измерительного инструмента (теста, опросника, шкалы), основанный на определении устойчивости результатов при повторном применении того же самого инструмента на той же выборке испытуемых через определённый промежуток времени. Ретестовая надёжность показывает, в какой степени баллы, полученные индивидом при первом тестировании, совпадают с баллами при повторном тестировании, при условии, что измеряемое свойство (например, интеллект, личностная черта, установка) остаётся стабильным. В психометрике этот показатель также называют коэффициентом стабильности или ретестовым коэффициентом.

История и теоретические основы

Понятие ретестовой надёжности восходит к ранним работам по психометрике начала XX века, когда Чарльз Спирмен и его последователи разрабатывали теорию надёжности измерений. Спирмен ввёл понятие «истинного балла» и ошибки измерения, а также предложил модели, позволяющие оценить, насколько результаты теста свободны от случайных колебаний. Ретестовая надёжность стала одним из первых практических способов проверки стабильности измерений, используемых в тестах интеллекта (например, в шкалах Бине — Симона) и личностных опросниках.

В 1930–1950-х годах психометрики, такие как Ли Кронбах и Фредерик Лорд, уточнили статистические методы расчёта ретестовой надёжности, показав, что её величина зависит не только от качества теста, но и от временного интервала, а также от природы измеряемого конструкта. В современной психометрике ретестовая надёжность рассматривается как одна из трёх основных форм надёжности (наряду с внутренней согласованностью и надёжностью параллельных форм) и является обязательной характеристикой для стандартизированных тестов, используемых в клинической, образовательной и организационной диагностике.

Методология расчёта

Процедура ретестирования

Для оценки ретестовой надёжности исследователь проводит тестирование на выборке испытуемых (обычно не менее 30–50 человек), а затем через определённый промежуток времени (ретестовый интервал) повторно предъявляет тот же самый тест тем же испытуемым. Условия проведения должны быть максимально идентичными: инструкция, время, обстановка, способ предъявления. Полученные пары баллов (первый и второй замеры) подвергаются статистическому анализу.

Коэффициент корреляции

Основным показателем ретестовой надёжности является коэффициент корреляции Пирсона (r) между результатами первого и второго тестирования. Значение r может варьироваться от 0 до 1. Чем ближе к 1, тем выше стабильность результатов. В психометрике приемлемым считается значение r ≥ 0,70 для исследовательских целей и r ≥ 0,80–0,90 для индивидуальной диагностики. Однако для некоторых конструктов (например, настроения, ситуативной тревожности) низкие значения ретестовой надёжности могут быть ожидаемы, так как само свойство нестабильно.

Влияние ретестового интервала

Длина временного интервала критически влияет на величину ретестовой надёжности. Слишком короткий интервал (например, несколько часов или один день) может привести к эффекту тренировки или запоминания ответов, что искусственно завысит корреляцию. Слишком длинный интервал (месяцы или годы) увеличивает вероятность реальных изменений измеряемого свойства, что снижает корреляцию. Оптимальный интервал зависит от природы конструкта: для стабильных черт (интеллект, экстраверсия) он может составлять от 2 недель до 6 месяцев; для более изменчивых состояний (настроение, усталость) — от нескольких дней до 2 недель. В стандартах Американской психологической ассоциации (APA) рекомендуется указывать интервал в отчёте о надёжности.

Другие статистические методы

Помимо корреляции Пирсона, для оценки ретестовой надёжности могут использоваться:

  • Внутриклассовый коэффициент корреляции (ICC) — учитывает не только линейную связь, но и систематические сдвиги средних значений (например, если все испытуемые во втором замере дали более высокие баллы из-за обучения).
  • Коэффициент конкордации — для оценки согласия между двумя замерами.
  • t-критерий Стьюдента для зависимых выборок — проверяет, не изменилось ли среднее значение по группе между тестированиями (значимое различие указывает на систематический сдвиг, что снижает надёжность).

Факторы, влияющие на ретестовую надёжность

Характеристики теста

  • Длина теста: более длинные тесты (больше пунктов) обычно имеют более высокую ретестовую надёжность, так как ошибка измерения усредняется.
  • Сложность заданий: тесты с заданиями средней трудности (не слишком лёгкие и не слишком сложные) дают более стабильные результаты.
  • Формат ответов: дихотомические шкалы (да/нет) могут иметь меньшую ретестовую надёжность по сравнению с многобалльными шкалами Лайкерта.

Характеристики выборки

  • Возраст: у детей младшего возраста ретестовая надёжность часто ниже из-за быстрых когнитивных изменений и нестабильности внимания.
  • Гетерогенность: на более разнородной выборке (по возрасту, образованию, уровню измеряемого свойства) корреляция обычно выше, чем на однородной.
  • Мотивация: испытуемые, не заинтересованные в тестировании, могут давать случайные ответы, снижая надёжность.

Условия проведения

  • Эффект тренировки: при повторном тестировании испытуемые могут запомнить конкретные ответы или стратегии решения, что искажает результаты. Для когнитивных тестов этот эффект особенно значим.
  • Эффект утомления: если интервал слишком короткий, испытуемые могут быть уставшими или скучающими.
  • Изменение внешних условий: шум, время суток, присутствие наблюдателя — все эти факторы могут влиять на результаты.

Применение в различных областях

Психология

В клинической психологии ретестовая надёжность используется для оценки стабильности диагностических инструментов, таких как опросники депрессии (например, шкала Бека), тревожности (шкала Спилбергера) или личностные тесты (MMPI, NEO-PI-R). Для тестов, предназначенных для отслеживания динамики состояния (например, в ходе терапии), ретестовая надёжность должна быть достаточно высокой, чтобы изменения в баллах отражали реальные изменения, а не случайные колебания.

Педагогика

В образовательном тестировании ретестовая надёжность важна для стандартизированных экзаменов (например, ЕГЭ в России, SAT в США). Если тест имеет низкую ретестовую надёжность, то результаты одного и того же ученика при повторной сдаче могут сильно различаться, что ставит под сомнение справедливость оценки знаний. Однако из-за эффекта тренировки ретестовая надёжность для экзаменов часто оценивается по параллельным формам, а не по повторному предъявлению одного и того же теста.

Социология и маркетинговые исследования

В опросниках общественного мнения и маркетинговых анкетах ретестовая надёжность позволяет проверить, насколько стабильны установки и предпочтения респондентов. Например, если респонденты через месяц дают совершенно другие ответы на вопрос о политических взглядах, это может указывать либо на низкую надёжность инструмента, либо на реальную изменчивость мнений.

Критика и ограничения

Ретестовая надёжность имеет ряд существенных ограничений, которые критикуются в современной психометрике:

  1. Эффект тренировки и запоминания: при повторном предъявлении одного и того же теста испытуемые могут улучшать свои результаты за счёт обучения, а не за счёт стабильности свойства. Это особенно проблематично для когнитивных тестов.
  2. Неприменимость для изменчивых конструктов: для свойств, которые по своей природе нестабильны (настроение, эмоциональное состояние, ситуативная тревожность), ретестовая надёжность не является адекватным показателем. В таких случаях предпочтительнее использовать внутреннюю согласованность или надёжность параллельных форм.
  3. Зависимость от интервала: нет универсального оптимального интервала, и его выбор субъективен. Разные интервалы могут давать совершенно разные оценки надёжности для одного и того же теста.
  4. Проблема реактивности: сам процесс повторного тестирования может изменить измеряемое свойство (например, если испытуемые начинают больше задумываться о своих ответах).

В связи с этим многие современные руководства по психометрике (например, Стандарты для образовательного и психологического тестирования, 2014) рекомендуют дополнять ретестовую надёжность другими методами, такими как анализ внутренней согласованности (альфа Кронбаха) и надёжность расщепления (split-half).

Примеры из практики

  • Шкала интеллекта Векслера (WAIS-IV): ретестовая надёжность для общего показателя IQ составляет около 0,90–0,95 при интервале 2–12 недель, что считается очень высоким показателем.
  • Опросник «Большая пятёрка» (NEO-PI-R): ретестовая надёжность для шкал личностных черт (нейротизм, экстраверсия и др.) составляет 0,80–0,90 при интервале 3–6 месяцев.
  • Шкала депрессии Бека (BDI-II): ретестовая надёжность около 0,75–0,85 при интервале 1–2 недели, что приемлемо для клинического инструмента.
  • Тест школьных достижений (например, PISA): ретестовая надёжность не оценивается напрямую из-за эффекта тренировки; вместо этого используются эквивалентные формы.

Связь с другими видами надёжности

Ретестовая надёжность дополняет другие аспекты надёжности:

  • Внутренняя согласованность (альфа Кронбаха) оценивает, насколько пункты теста измеряют одно и то же свойство, но не учитывает стабильность во времени.
  • Надёжность параллельных форм (эквивалентных вариантов теста) позволяет избежать эффекта тренировки, но требует разработки двух эквивалентных версий, что трудоёмко.
  • Надёжность расщепления (split-half) оценивает согласованность половин теста, но не даёт информации о временной стабильности.

В идеале для валидного теста должны быть представлены данные по всем трём видам надёжности, включая ретестовую, с указанием интервала и условий проведения.

Источники

  1. Клайн, П. (1994). Справочник по тестированию способностей и достижений. Лондон: Routledge.
  2. Кронбах, Л. Дж. (1951). Коэффициент альфа и внутренняя структура тестов. Psychometrika, 16(3), 297–334.
  3. Наннли, Дж. К., и Бернштейн, И. Х. (1994). Психометрическая теория (3-е изд.). Нью-Йорк: McGraw-Hill.
  4. Американская психологическая ассоциация, Американская ассоциация образовательных исследований и Национальный совет по измерениям в образовании. (2014). Стандарты для образовательного и психологического тестирования. Вашингтон, округ Колумбия: APA.
  5. Шмелёв, А. Г. (2002). Психодиагностика личностных черт. СПб.: Речь.
  6. Бодалёв, А. А., Столин, В. В. (ред.). (2000). Общая психодиагностика. СПб.: Речь.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →