Открыть сервис

Классическая теория тестов

Классическая теория тестов (Classical Test Theory, CTT) — это совокупность психометрических моделей и методов, описывающих связь между наблюдаемым результатом измерения (тестовым баллом) и истинным значением измеряемого свойства (латентной переменной). Является одним из фундаментальных разделов психометрики, наряду с теорией моделирования латентных черт (IRT). В основе CTT лежит представление о том, что любой наблюдаемый результат теста состоит из двух компонентов: истинного балла и случайной ошибки измерения.

Основные положения

Модель истинного балла

Центральная идея классической теории тестов формализуется уравнением:

\[ X = T + E \]

где:

  • \(X\) — наблюдаемый (эмпирический) балл испытуемого по тесту;
  • \(T\) — истинный балл (латентная характеристика, свободная от ошибок измерения);
  • \(E\) — случайная ошибка измерения.

Согласно аксиомам CTT, истинный балл \(T\) является математическим ожиданием наблюдаемого балла \(X\) при бесконечном повторении тестирования одного и того же испытуемого. Ошибка \(E\) имеет нулевое математическое ожидание и не коррелирует с истинным баллом. На практике это означает, что при многократном тестировании одного человека среднее арифметическое его наблюдаемых баллов стремится к истинному баллу.

Аксиомы классической теории тестов

  1. Аксиома линейности: наблюдаемый балл равен сумме истинного балла и ошибки.
  2. Аксиома нулевого среднего ошибки: математическое ожидание ошибки равно нулю (\(M(E)=0\)).
  3. Аксиома независимости ошибки и истинного балла: ошибка не коррелирует с истинным баллом (\(r_{TE}=0\)).
  4. Аксиома независимости ошибок разных измерений: ошибки разных тестовых заданий (или разных тестов) не коррелируют между собой (\(r_{E_iE_j}=0\) для \(i \neq j\)).

Эти аксиомы позволяют вывести основные соотношения между дисперсиями: \(\sigma^2_X = \sigma^2_T + \sigma^2_E\), где \(\sigma^2_X\) — дисперсия наблюдаемых баллов, \(\sigma^2_T\) — дисперсия истинных баллов, \(\sigma^2_E\) — дисперсия ошибок.

Надёжность

Определение и коэффициент надёжности

Надёжность теста — это степень согласованности результатов измерений при повторных применениях теста к одним и тем же испытуемым. В CTT надёжность количественно выражается через коэффициент надёжности (\(r_{xx'}\)), который равен доле дисперсии истинных баллов в общей дисперсии наблюдаемых баллов:

\[ r_{xx'} = \frac{\sigma^2_T}{\sigma^2_X} \]

Коэффициент надёжности принимает значения от 0 до 1. Чем ближе к 1, тем меньше влияние случайных ошибок и тем точнее тест измеряет истинное свойство. На практике значения выше 0,80 считаются приемлемыми для исследовательских целей, а выше 0,90 — для индивидуальной диагностики.

Методы оценки надёжности

  1. Ретестовая надёжность (test-retest reliability): тест проводится дважды на одной выборке с интервалом во времени. Коэффициент корреляции между результатами двух тестирований является оценкой надёжности. Недостаток — влияние эффекта тренировки и памяти.
  2. Надёжность параллельных форм: создаются две эквивалентные версии теста, которые предъявляются одной группе. Корреляция между результатами — оценка надёжности. Требует тщательной разработки параллельных форм.
  3. Надёжность расщепления (split-half reliability): тест делится на две половины (например, чётные и нечётные задания), вычисляется корреляция между ними, а затем корректируется по формуле Спирмена — Брауна.
  4. Внутренняя согласованность (internal consistency): наиболее распространённый метод, основанный на анализе ковариаций между заданиями. Основные показатели:
  • Коэффициент альфа Кронбаха (\(\alpha\)): средняя корреляция между всеми заданиями теста. Формула: \(\alpha = \frac{k}{k-1}\left(1 - \frac{\sum \sigma^2_i}{\sigma^2_X}\right)\), где \(k\) — число заданий, \(\sigma^2_i\) — дисперсия i-го задания, \(\sigma^2_X\) — дисперсия суммарного балла.
  • Коэффициент Кудера — Ричардсона (KR-20, KR-21): применяется для дихотомических заданий (правильно/неправильно).

Стандартная ошибка измерения

Стандартная ошибка измерения (\(SEM\)) — это оценка разброса наблюдаемых баллов вокруг истинного балла. Вычисляется как:

\[ SEM = \sigma_X \cdot \sqrt{1 - r_{xx'}} \]

где \(\sigma_X\) — стандартное отклонение наблюдаемых баллов. \(SEM\) позволяет построить доверительные интервалы для истинного балла испытуемого. Например, с вероятностью 95% истинный балл находится в интервале \(X \pm 1,96 \cdot SEM\).

Валидность

Валидность теста — это степень, в которой тест измеряет именно то свойство, для оценки которого он предназначен. В CTT валидность рассматривается как характеристика не самого теста, а интерпретации его результатов. Различают несколько типов валидности:

  • Содержательная валидность (content validity): отражает, насколько задания теста адекватно представляют измеряемую область знаний или поведения. Оценивается экспертами.
  • Критериальная валидность (criterion validity): показывает, насколько результаты теста коррелируют с внешним критерием (например, с успеваемостью, профессиональной успешностью). Делится на текущую (concurent) — корреляция с критерием, измеренным одновременно, и прогностическую (predictive) — корреляция с критерием, измеренным в будущем.
  • Конструктная валидность (construct validity): проверяется, насколько тест измеряет теоретический конструкт (например, интеллект, тревожность). Оценивается через корреляции с другими тестами, измеряющими тот же или смежные конструкты, а также через факторный анализ.

Применение и ограничения

Применение

Классическая теория тестов широко используется в:

  • Педагогических измерениях: разработка и анализ тестов успеваемости, экзаменационных заданий.
  • Психологической диагностике: конструирование личностных опросников, тестов способностей, шкал установок.
  • Медицинских исследованиях: оценка качества жизни, симптоматических шкал.
  • Социологических опросах: анализ надёжности шкал и индексов.

Ограничения

  1. Зависимость от выборки: все показатели (надёжность, валидность) зависят от характеристик выборки, на которой они получены. Например, коэффициент альфа Кронбаха может быть высоким на гетерогенной выборке и низким на гомогенной.
  2. Неинвариантность: трудность заданий и дискриминативность (способность различать испытуемых с разным уровнем способности) зависят от распределения истинных баллов в выборке.
  3. Линейность: модель предполагает линейную связь между наблюдаемым и истинным баллом, что не всегда соответствует реальности.
  4. Неучёт многомерности: CTT работает с одномерными конструктами; для многомерных тестов требуется более сложный анализ.

Сравнение с современными подходами

В отличие от классической теории тестов, теория моделирования латентных черт (Item Response Theory, IRT) предлагает более гибкие модели, в которых параметры заданий (трудность, дискриминативность, вероятность угадывания) не зависят от выборки, а способности испытуемых — от набора заданий. IRT позволяет строить компьютерные адаптивные тесты, сравнивать результаты разных тестов и получать более точные оценки. Однако CTT остаётся популярной благодаря простоте, меньшим требованиям к объёму выборки и наглядности интерпретации.

Историческая справка

Основы классической теории тестов были заложены в начале XX века. В 1904 году Чарльз Спирмен опубликовал работу, в которой ввёл понятие истинного балла и ошибки измерения. В 1930-х годах Луис Гуттман, Ли Кронбах и другие исследователи развили методы оценки надёжности. В 1950-х годах Фредерик Лорд и Мелвин Новик систематизировали CTT в монографии «Statistical Theories of Mental Test Scores». Несмотря на появление более сложных моделей, CTT остаётся основой для большинства практических приложений в психометрии и педагогических измерениях.

Источники

  • Лорд Ф., Новик М. Статистические теории умственных тестов. — М.: Педагогика, 1971.
  • Клайн П. Справочное руководство по конструированию тестов. — Киев: ПАН Лтд, 1994.
  • Анастази А., Урбина С. Психологическое тестирование. — СПб.: Питер, 2001.
  • Crocker L., Algina J. Introduction to Classical and Modern Test Theory. — Holt, Rinehart and Winston, 1986.
  • Nunnally J. C., Bernstein I. H. Psychometric Theory. — 3rd ed. — McGraw-Hill, 1994.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →