Теория латентных черт
Теория латентных черт (латентно-структурный анализ, Item Response Theory, IRT) — это класс математических моделей в психометрии, социологии и педагогике, предназначенных для измерения скрытых (латентных) характеристик индивидов на основе их ответов на задания тестов или пункты опросников. В отличие от классической теории тестов (Classical Test Theory, CTT), которая оперирует суммарными баллами, IRT моделирует вероятность каждого ответа как функцию от уровня латентной черты и параметров задания (сложность, дискриминативность, вероятность угадывания). Теория лежит в основе современного компьютерного адаптивного тестирования, оценки качества заданий и шкалирования результатов.
История возникновения и развития
Корни теории латентных черт восходят к работам датского математика Георга Раша (Georg Rasch), который в 1960 году опубликовал модель дихотомического ответа (модель Раша). В 1968 году американские психометрики Фредерик Лорд (Frederic Lord) и Мелвин Новик (Melvin Novick) в книге «Statistical Theories of Mental Test Scores» заложили основы современной IRT. В 1970–1980-е годы были разработаны многопараметрические модели (2PL, 3PL), а также модели для политомических (многоуровневых) ответов. С 1990-х годов IRT активно применяется в крупномасштабных образовательных тестированиях (PISA, TIMSS, ЕГЭ) и в адаптивных тестах (GRE, GMAT). В России теория латентных черт получила развитие в работах В. А. Аванесова, В. С. Аванесова, А. Г. Шмелёва и других.
Основные понятия и допущения
Латентная черта
Латентная черта (θ) — это гипотетическая непрерывная характеристика индивида, которую нельзя измерить непосредственно (например, уровень математических способностей, экстраверсия, удовлетворённость жизнью). В IRT предполагается, что θ распределена в популяции по нормальному закону (часто с нулевым средним и единичной дисперсией).
Локальная независимость
Вероятность ответа на одно задание не зависит от ответов на другие задания при фиксированном уровне θ. Это условие позволяет строить совместную функцию правдоподобия как произведение вероятностей по всем заданиям.
Характеристическая кривая задания (Item Characteristic Curve, ICC)
ICC — это функция, описывающая вероятность правильного ответа (или положительного ответа в дихотомической шкале) в зависимости от θ. Форма кривой определяется параметрами задания.
Основные модели IRT
Модель Раша (1PL — один параметр)
Модель Раша использует только один параметр задания — сложность (b). Вероятность правильного ответа для индивида с уровнем θ: \[ P(X=1|\theta, b) = \frac{e^{(\theta - b)}}{1 + e^{(\theta - b)}} \] Здесь b — точка на шкале θ, где вероятность правильного ответа равна 0,5. Модель предполагает, что все задания имеют одинаковую дискриминативность (наклон кривой) и отсутствие угадывания.
Двухпараметрическая модель (2PL)
Добавляет параметр дискриминативности (a), который отражает крутизну ICC. Чем выше a, тем лучше задание различает испытуемых с разными уровнями θ: \[ P(X=1|\theta, a, b) = \frac{e^{a(\theta - b)}}{1 + e^{a(\theta - b)}} \]
Трёхпараметрическая модель (3PL)
Включает параметр псевдоугадывания (c) — нижнюю асимптоту ICC, соответствующую вероятности правильного ответа при очень низком θ (например, случайное угадывание в тесте с четырьмя вариантами даёт c ≈ 0,25): \[ P(X=1|\theta, a, b, c) = c + (1 - c) \cdot \frac{e^{a(\theta - b)}}{1 + e^{a(\theta - b)}} \]
Политомические модели
Для заданий с несколькими категориями ответов (например, шкала Лайкерта) используются модели:
- Модель частичного кредита (Partial Credit Model, PCM) — обобщение модели Раша на политомические данные.
- Модель градуированного ответа (Graded Response Model, GRM) — для упорядоченных категорий.
- Модель номинального ответа (Nominal Response Model, NRM) — для неупорядоченных категорий.
Оценка параметров и подгонка модели
Оценка параметров заданий
Параметры a, b, c обычно оцениваются методами максимального правдоподобия (MLE), байесовскими методами (EAP, MAP) или с помощью маргинального максимального правдоподобия (MML). Для этого используются итеративные алгоритмы (например, EM-алгоритм).
Оценка уровня латентной черты
После калибровки заданий θ для каждого испытуемого оценивается на основе его ответов. Применяются методы:
- Максимальное правдоподобие (MLE) — даёт несмещённые оценки при большом количестве заданий.
- Байесовские оценки (EAP, MAP) — более устойчивы при малом числе заданий.
Информационная функция и точность измерения
Информационная функция задания (Item Information Function, IIF) показывает, какой вклад задание вносит в оценку θ на разных уровнях шкалы. Суммарная информационная функция теста (Test Information Function, TIF) обратно пропорциональна стандартной ошибке измерения (SEM). Чем выше TIF в данном диапазоне θ, тем точнее измерение.
Применение теории латентных черт
Компьютерное адаптивное тестирование (CAT)
IRT лежит в основе CAT, где каждое следующее задание подбирается на основе текущей оценки θ испытуемого. Это позволяет сократить длину теста при сохранении точности. CAT используется в:
- Graduate Record Examination (GRE) — вступительный тест в аспирантуру в США.
- Graduate Management Admission Test (GMAT) — тест для поступления в бизнес-школы.
- Единый государственный экзамен (ЕГЭ) в России — с 2020 года внедряются элементы адаптивного тестирования по некоторым предметам.
Оценка качества заданий
Параметры IRT позволяют выявить «плохие» задания: с низкой дискриминативностью (a < 0,5), аномально высокой сложностью (b > 3) или высоким угадыванием (c > 0,4). Это используется при разработке тестов в образовании и психологии.
Шкалирование и эквивалентирование
IRT позволяет приводить результаты разных форм теста к единой шкале (например, шкала PISA — от 0 до 1000). Это необходимо для сравнения результатов разных лет или разных версий теста.
Психологическая диагностика
В клинической психологии и психиатрии IRT применяется для измерения латентных черт, таких как уровень депрессии (шкала Бека), тревожности (шкала Спилбергера) или качества жизни. Модели позволяют создавать короткие скрининговые инструменты с высокой точностью.
Преимущества и ограничения
Преимущества
- Инвариантность оценок: параметры заданий не зависят от выборки испытуемых, а оценки θ — от набора заданий (при условии адекватности модели).
- Точность измерения: IRT позволяет оценить погрешность для каждого уровня θ, а не единую для всего теста.
- Гибкость: возможность создания адаптивных тестов, сравнения разных форм теста, выявления неэффективных заданий.
Ограничения
- Вычислительная сложность: оценка параметров требует больших объёмов данных (не менее 200–500 испытуемых) и мощных алгоритмов.
- Предположения: модель требует проверки локальной независимости, однородности латентной черты и соответствия эмпирических данных теоретической кривой.
- Многомерность: реальные тесты часто измеряют несколько латентных черт одновременно, что требует многомерных моделей IRT (MIRT), которые сложнее в интерпретации.
Критика и альтернативы
Некоторые исследователи критикуют IRT за чрезмерную математическую сложность и трудности в интерпретации для практиков. В качестве альтернатив используются:
- Классическая теория тестов (CTT) — проще, но менее точна и не позволяет адаптивного тестирования.
- Теория обобщённых линейных моделей (GLM) — более гибкий статистический подход, но без специфики IRT.
- Байесовские сети — для моделирования зависимостей между заданиями.
См. также
- Психометрика
- Тестология
- Факторный анализ
- Шкалирование
Источники
- Lord F. M., Novick M. R. Statistical Theories of Mental Test Scores. — Reading, MA: Addison-Wesley, 1968.
- Rasch G. Probabilistic Models for Some Intelligence and Attainment Tests. — Copenhagen: Danish Institute for Educational Research, 1960.
- Hambleton R. K., Swaminathan H. Item Response Theory: Principles and Applications. — Boston: Kluwer-Nijhoff, 1985.
- Аванесов В. С. Теория и практика педагогических измерений. — М.: Центр тестирования, 2005.
- Embretson S. E., Reise S. P. Item Response Theory for Psychologists. — Mahwah, NJ: Lawrence Erlbaum, 2000.
- Baker F. B., Kim S.-H. Item Response Theory: Parameter Estimation Techniques. — 2nd ed. — New York: Marcel Dekker, 2004.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →