Открыть сервис

Тестометрика в психологии и образовании

Тестометрика — раздел прикладной статистики и психометрии, изучающий математические и статистические свойства тестов как измерительных инструментов. Она охватывает методы оценки надёжности, валидности, трудности заданий, дискриминативности пунктов и построения шкал, позволяющие перейти от сырых баллов к сопоставимым количественным показателям. Тестометрика лежит на стыке теории измерений, математической статистики, педагогики и психологии и служит теоретической основой разработки и анализа тестов в образовании, профессиональном отборе и научных исследованиях.

Предмет и задачи

Основная задача тестометрики — установить, в какой мере результаты тестирования отражают измеряемое свойство, а не случайные факторы. Для этого решаются несколько типовых задач:

  • оценка надёжности теста, то есть устойчивости результатов при повторном применении или при использовании параллельных форм;
  • оценка валидности — соответствия теста тому конструкту, который он призван измерять;
  • анализ отдельных заданий: их трудность, различающая способность, связь с общим баллом;
  • построение шкал и нормирование, то есть перевод сырых баллов в стандартизированные показатели;
  • выявление систематических искажений, связанных с условиями проведения или особенностями выборки.

История

Предпосылки тестометрики сложились на рубеже XIX–XX веков. Английский статистик Карл Пирсон разработал корреляционный анализ, а Чарльз Спирмен предложил идею генерального фактора и методы факторного анализа. В 1904 году Спирмен опубликовал работу о «недостоверности» измерений, заложившую основы классической теории тестов.

Существенный вклад внёс Луис Тёрстоун, развивший многофакторный анализ и методы шкалирования. В середине XX века Ли Кронбах ввёл коэффициент внутренней согласованности, названный его именем, а Джордж Раш предложил модель измерения, основанную на логистической функции. В 1960-е годы датский математик Георг Раш развил однопараметрическую модель, положившую начало современной теории тестов. В дальнейшем Фредерик Лорд и Мелвин Новик систематизировали теорию отклика на задание, ставшую альтернативой классическому подходу.

В России и СССР тестометрические методы развивались в рамках педологии в 1920-е годы, затем были прерваны, а с 1960-х годов возобновились в работах по педагогическим измерениям и профессиональному отбору. В постсоветский период тестометрика вошла в практику единого государственного экзамена и массовых психологических обследований.

Классическая теория тестов

Классическая теория тестов исходит из модели, в которой наблюдаемый балл X равен сумме истинного балла T и ошибки измерения E:

X = T + E.

Из этой модели выводятся ключевые допущения: ошибка имеет нулевое среднее, не коррелирует с истинным баллом и с ошибками других измерений. Надёжность определяется как отношение дисперсии истинных баллов к дисперсии наблюдаемых:

ρ = σ²(T) / σ²(X).

Практически надёжность оценивают через коэффициент Кронбаха, коэффициент «расщеплённой надёжности» Спирмена — Брауна, метод параллельных форм и метод «тест — ретест». Значения выше 0,8 обычно считаются приемлемыми для групповых решений, выше 0,9 — для индивидуальных.

Современная теория тестов

Теория отклика на задание (IRT) описывает вероятность правильного ответа как функцию латентного параметра испытуемого и характеристик задания. Наиболее известна трёхпараметрическая логистическая модель:

P(θ) = c + (1 − c) / (1 + exp(−a(θ − b))),

где θ — уровень подготовленности, a — дискриминативность, b — трудность, c — вероятность угадывания. Однопараметрическая модель Раша фиксирует a = 1 и c = 0.

Преимущество IRT состоит в независимости оценок параметров заданий от выборки и параметров испытуемых от конкретного набора заданий. Это позволяет строить адаптивные тесты, в которых сложность следующего задания подбирается под текущий уровень отвечающего.

Анализ заданий

Для каждого пункта теста вычисляются показатели:

  • трудность — доля правильных ответов или соответствующий параметр b;
  • дискриминативность — корреляция ответа на пункт с общим баллом, часто точечно-бисериальный коэффициент;
  • эффективность дистракторов — частота выбора каждого неправильного варианта;
  • индекс согласованности с ключом.

Задания с низкой дискриминативностью или аномальной трудностью исключаются или перерабатываются.

Применение

Тестометрика применяется при разработке и экспертизе тестов в образовании (единый государственный экзамен, международные сопоставительные исследования), в психологической диагностике, при профессиональном отборе и аттестации персонала, в медицине и социологии. Она обеспечивает сопоставимость результатов разных лет и выборок, обосновывает нормы и пороговые баллы.

Критика и ограничения

Классическая теория тестов зависит от выборки: показатели надёжности и трудности меняются при переходе к другой группе. Модели IRT требуют больших выборок и проверки допущений, в частности одномерности и локальной независимости. Кроме того, статистическая корректность теста не гарантирует его содержательной справедливости: возможны культурные и языковые искажения, а также нежелательные социальные последствия использования результатов. Эти ограничения обсуждаются в рамках дискуссий о справедливости тестирования и этике измерений.

Источники: работы Ч. Спирмена, Л. Кронбаха, Г. Раша, Ф. Лорда и М. Новика по теории тестов; учебники по психометрии и педагогическим измерениям; материалы исследований по единому государственному экзамену.