Классическая теория тестов¶
Классическая теория тестов (Classical Test Theory, CTT) — это совокупность психометрических моделей и методов, описывающих связь между наблюдаемым результатом измерения (тестовым баллом) и истинным значением измеряемого свойства (латентной переменной). Является одним из фундаментальных разделов психометрики, наряду с теорией моделирования латентных черт (IRT). В основе CTT лежит представление о том, что любой наблюдаемый результат теста состоит из двух компонентов: истинного балла и случайной ошибки измерения.
¶Основные положения
¶Модель истинного балла
Центральная идея классической теории тестов формализуется уравнением:
\[ X = T + E \]
где:
- \(X\) — наблюдаемый (эмпирический) балл испытуемого по тесту;
- \(T\) — истинный балл (латентная характеристика, свободная от ошибок измерения);
- \(E\) — случайная ошибка измерения.
Согласно аксиомам CTT, истинный балл \(T\) является математическим ожиданием наблюдаемого балла \(X\) при бесконечном повторении тестирования одного и того же испытуемого. Ошибка \(E\) имеет нулевое математическое ожидание и не коррелирует с истинным баллом. На практике это означает, что при многократном тестировании одного человека среднее арифметическое его наблюдаемых баллов стремится к истинному баллу.
¶Аксиомы классической теории тестов
- Аксиома линейности: наблюдаемый балл равен сумме истинного балла и ошибки.
- Аксиома нулевого среднего ошибки: математическое ожидание ошибки равно нулю (\(M(E)=0\)).
- Аксиома независимости ошибки и истинного балла: ошибка не коррелирует с истинным баллом (\(r_{TE}=0\)).
- Аксиома независимости ошибок разных измерений: ошибки разных тестовых заданий (или разных тестов) не коррелируют между собой (\(r_{E_iE_j}=0\) для \(i \neq j\)).
Эти аксиомы позволяют вывести основные соотношения между дисперсиями: \(\sigma^2_X = \sigma^2_T + \sigma^2_E\), где \(\sigma^2_X\) — дисперсия наблюдаемых баллов, \(\sigma^2_T\) — дисперсия истинных баллов, \(\sigma^2_E\) — дисперсия ошибок.
¶Надёжность
¶Определение и коэффициент надёжности
Надёжность теста — это степень согласованности результатов измерений при повторных применениях теста к одним и тем же испытуемым. В CTT надёжность количественно выражается через коэффициент надёжности (\(r_{xx'}\)), который равен доле дисперсии истинных баллов в общей дисперсии наблюдаемых баллов:
\[ r_{xx'} = \frac{\sigma^2_T}{\sigma^2_X} \]
Коэффициент надёжности принимает значения от 0 до 1. Чем ближе к 1, тем меньше влияние случайных ошибок и тем точнее тест измеряет истинное свойство. На практике значения выше 0,80 считаются приемлемыми для исследовательских целей, а выше 0,90 — для индивидуальной диагностики.
¶Методы оценки надёжности
- Ретестовая надёжность (test-retest reliability): тест проводится дважды на одной выборке с интервалом во времени. Коэффициент корреляции между результатами двух тестирований является оценкой надёжности. Недостаток — влияние эффекта тренировки и памяти.
- Надёжность параллельных форм: создаются две эквивалентные версии теста, которые предъявляются одной группе. Корреляция между результатами — оценка надёжности. Требует тщательной разработки параллельных форм.
- Надёжность расщепления (split-half reliability): тест делится на две половины (например, чётные и нечётные задания), вычисляется корреляция между ними, а затем корректируется по формуле Спирмена — Брауна.
- Внутренняя согласованность (internal consistency): наиболее распространённый метод, основанный на анализе ковариаций между заданиями. Основные показатели:
- Коэффициент альфа Кронбаха (\(\alpha\)): средняя корреляция между всеми заданиями теста. Формула: \(\alpha = \frac{k}{k-1}\left(1 - \frac{\sum \sigma^2_i}{\sigma^2_X}\right)\), где \(k\) — число заданий, \(\sigma^2_i\) — дисперсия i-го задания, \(\sigma^2_X\) — дисперсия суммарного балла.
- Коэффициент Кудера — Ричардсона (KR-20, KR-21): применяется для дихотомических заданий (правильно/неправильно).
¶Стандартная ошибка измерения
Стандартная ошибка измерения (\(SEM\)) — это оценка разброса наблюдаемых баллов вокруг истинного балла. Вычисляется как:
\[ SEM = \sigma_X \cdot \sqrt{1 - r_{xx'}} \]
где \(\sigma_X\) — стандартное отклонение наблюдаемых баллов. \(SEM\) позволяет построить доверительные интервалы для истинного балла испытуемого. Например, с вероятностью 95% истинный балл находится в интервале \(X \pm 1,96 \cdot SEM\).
¶Валидность
Валидность теста — это степень, в которой тест измеряет именно то свойство, для оценки которого он предназначен. В CTT валидность рассматривается как характеристика не самого теста, а интерпретации его результатов. Различают несколько типов валидности:
- Содержательная валидность (content validity): отражает, насколько задания теста адекватно представляют измеряемую область знаний или поведения. Оценивается экспертами.
- Критериальная валидность (criterion validity): показывает, насколько результаты теста коррелируют с внешним критерием (например, с успеваемостью, профессиональной успешностью). Делится на текущую (concurent) — корреляция с критерием, измеренным одновременно, и прогностическую (predictive) — корреляция с критерием, измеренным в будущем.
- Конструктная валидность (construct validity): проверяется, насколько тест измеряет теоретический конструкт (например, интеллект, тревожность). Оценивается через корреляции с другими тестами, измеряющими тот же или смежные конструкты, а также через факторный анализ.
¶Применение и ограничения
¶Применение
Классическая теория тестов широко используется в:
- Педагогических измерениях: разработка и анализ тестов успеваемости, экзаменационных заданий.
- Психологической диагностике: конструирование личностных опросников, тестов способностей, шкал установок.
- Медицинских исследованиях: оценка качества жизни, симптоматических шкал.
- Социологических опросах: анализ надёжности шкал и индексов.
¶Ограничения
- Зависимость от выборки: все показатели (надёжность, валидность) зависят от характеристик выборки, на которой они получены. Например, коэффициент альфа Кронбаха может быть высоким на гетерогенной выборке и низким на гомогенной.
- Неинвариантность: трудность заданий и дискриминативность (способность различать испытуемых с разным уровнем способности) зависят от распределения истинных баллов в выборке.
- Линейность: модель предполагает линейную связь между наблюдаемым и истинным баллом, что не всегда соответствует реальности.
- Неучёт многомерности: CTT работает с одномерными конструктами; для многомерных тестов требуется более сложный анализ.
¶Сравнение с современными подходами
В отличие от классической теории тестов, теория моделирования латентных черт (Item Response Theory, IRT) предлагает более гибкие модели, в которых параметры заданий (трудность, дискриминативность, вероятность угадывания) не зависят от выборки, а способности испытуемых — от набора заданий. IRT позволяет строить компьютерные адаптивные тесты, сравнивать результаты разных тестов и получать более точные оценки. Однако CTT остаётся популярной благодаря простоте, меньшим требованиям к объёму выборки и наглядности интерпретации.
¶Историческая справка
Основы классической теории тестов были заложены в начале XX века. В 1904 году Чарльз Спирмен опубликовал работу, в которой ввёл понятие истинного балла и ошибки измерения. В 1930-х годах Луис Гуттман, Ли Кронбах и другие исследователи развили методы оценки надёжности. В 1950-х годах Фредерик Лорд и Мелвин Новик систематизировали CTT в монографии «Statistical Theories of Mental Test Scores». Несмотря на появление более сложных моделей, CTT остаётся основой для большинства практических приложений в психометрии и педагогических измерениях.
¶Источники
- Лорд Ф., Новик М. Статистические теории умственных тестов. — М.: Педагогика, 1971.
- Клайн П. Справочное руководство по конструированию тестов. — Киев: ПАН Лтд, 1994.
- Анастази А., Урбина С. Психологическое тестирование. — СПб.: Питер, 2001.
- Crocker L., Algina J. Introduction to Classical and Modern Test Theory. — Holt, Rinehart and Winston, 1986.
- Nunnally J. C., Bernstein I. H. Psychometric Theory. — 3rd ed. — McGraw-Hill, 1994.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


