Тестометрика в психологии и образовании¶
Тестометрика — раздел прикладной статистики и психометрии, изучающий математические и статистические свойства тестов как измерительных инструментов. Она охватывает методы оценки надёжности, валидности, трудности заданий, дискриминативности пунктов и построения шкал, позволяющие перейти от сырых баллов к сопоставимым количественным показателям. Тестометрика лежит на стыке теории измерений, математической статистики, педагогики и психологии и служит теоретической основой разработки и анализа тестов в образовании, профессиональном отборе и научных исследованиях.
¶Предмет и задачи
Основная задача тестометрики — установить, в какой мере результаты тестирования отражают измеряемое свойство, а не случайные факторы. Для этого решаются несколько типовых задач:
- оценка надёжности теста, то есть устойчивости результатов при повторном применении или при использовании параллельных форм;
- оценка валидности — соответствия теста тому конструкту, который он призван измерять;
- анализ отдельных заданий: их трудность, различающая способность, связь с общим баллом;
- построение шкал и нормирование, то есть перевод сырых баллов в стандартизированные показатели;
- выявление систематических искажений, связанных с условиями проведения или особенностями выборки.
¶История
Предпосылки тестометрики сложились на рубеже XIX–XX веков. Английский статистик Карл Пирсон разработал корреляционный анализ, а Чарльз Спирмен предложил идею генерального фактора и методы факторного анализа. В 1904 году Спирмен опубликовал работу о «недостоверности» измерений, заложившую основы классической теории тестов.
Существенный вклад внёс Луис Тёрстоун, развивший многофакторный анализ и методы шкалирования. В середине XX века Ли Кронбах ввёл коэффициент внутренней согласованности, названный его именем, а Джордж Раш предложил модель измерения, основанную на логистической функции. В 1960-е годы датский математик Георг Раш развил однопараметрическую модель, положившую начало современной теории тестов. В дальнейшем Фредерик Лорд и Мелвин Новик систематизировали теорию отклика на задание, ставшую альтернативой классическому подходу.
В России и СССР тестометрические методы развивались в рамках педологии в 1920-е годы, затем были прерваны, а с 1960-х годов возобновились в работах по педагогическим измерениям и профессиональному отбору. В постсоветский период тестометрика вошла в практику единого государственного экзамена и массовых психологических обследований.
¶Классическая теория тестов
Классическая теория тестов исходит из модели, в которой наблюдаемый балл X равен сумме истинного балла T и ошибки измерения E:
X = T + E.
Из этой модели выводятся ключевые допущения: ошибка имеет нулевое среднее, не коррелирует с истинным баллом и с ошибками других измерений. Надёжность определяется как отношение дисперсии истинных баллов к дисперсии наблюдаемых:
ρ = σ²(T) / σ²(X).
Практически надёжность оценивают через коэффициент Кронбаха, коэффициент «расщеплённой надёжности» Спирмена — Брауна, метод параллельных форм и метод «тест — ретест». Значения выше 0,8 обычно считаются приемлемыми для групповых решений, выше 0,9 — для индивидуальных.
¶Современная теория тестов
Теория отклика на задание (IRT) описывает вероятность правильного ответа как функцию латентного параметра испытуемого и характеристик задания. Наиболее известна трёхпараметрическая логистическая модель:
P(θ) = c + (1 − c) / (1 + exp(−a(θ − b))),
где θ — уровень подготовленности, a — дискриминативность, b — трудность, c — вероятность угадывания. Однопараметрическая модель Раша фиксирует a = 1 и c = 0.
Преимущество IRT состоит в независимости оценок параметров заданий от выборки и параметров испытуемых от конкретного набора заданий. Это позволяет строить адаптивные тесты, в которых сложность следующего задания подбирается под текущий уровень отвечающего.
¶Анализ заданий
Для каждого пункта теста вычисляются показатели:
- трудность — доля правильных ответов или соответствующий параметр b;
- дискриминативность — корреляция ответа на пункт с общим баллом, часто точечно-бисериальный коэффициент;
- эффективность дистракторов — частота выбора каждого неправильного варианта;
- индекс согласованности с ключом.
Задания с низкой дискриминативностью или аномальной трудностью исключаются или перерабатываются.
¶Применение
Тестометрика применяется при разработке и экспертизе тестов в образовании (единый государственный экзамен, международные сопоставительные исследования), в психологической диагностике, при профессиональном отборе и аттестации персонала, в медицине и социологии. Она обеспечивает сопоставимость результатов разных лет и выборок, обосновывает нормы и пороговые баллы.
¶Критика и ограничения
Классическая теория тестов зависит от выборки: показатели надёжности и трудности меняются при переходе к другой группе. Модели IRT требуют больших выборок и проверки допущений, в частности одномерности и локальной независимости. Кроме того, статистическая корректность теста не гарантирует его содержательной справедливости: возможны культурные и языковые искажения, а также нежелательные социальные последствия использования результатов. Эти ограничения обсуждаются в рамках дискуссий о справедливости тестирования и этике измерений.
Источники: работы Ч. Спирмена, Л. Кронбаха, Г. Раша, Ф. Лорда и М. Новика по теории тестов; учебники по психометрии и педагогическим измерениям; материалы исследований по единому государственному экзамену.