Компьютерные адаптивные тесты¶
Компьютерные адаптивные тесты (англ. Computerized Adaptive Testing, CAT) — это форма тестирования, при которой задания предъявляются испытуемому в зависимости от его предыдущих ответов, с целью оценки уровня знаний или способностей с максимальной точностью при минимальном количестве вопросов. В отличие от традиционных бланковых или компьютерных тестов с фиксированным набором заданий, адаптивные тесты динамически подбирают сложность и содержание каждого следующего вопроса, опираясь на текущую оценку уровня испытуемого. Основой для таких тестов служит математическая модель, чаще всего из теории вероятностей — теория тестирования (Item Response Theory, IRT), которая связывает вероятность правильного ответа с параметрами задания (сложность, дискриминативность, угадывание) и уровнем способности человека.
¶История
Идея адаптивного тестирования возникла в середине XX века, когда психометрики осознали недостатки традиционных тестов с фиксированной длиной. В 1950-х годах Фредерик Лорд (США) разработал основы теории IRT, которая позволила математически описывать поведение заданий и оценивать способности независимо от конкретного набора вопросов. Первые компьютерные адаптивные тесты стали возможны с появлением достаточно мощных компьютеров в 1970–1980-х годах. В 1984 году в США был запущен первый крупный проект CAT — Graduate Record Examination (GRE) в компьютерной версии, хотя полностью адаптивным он стал позже. В 1990-х годах адаптивные тесты начали внедряться в образовательное тестирование (например, TOEFL iBT, GMAT), а также в профессиональные сертификации (например, для медсестёр, инженеров). В России адаптивные тесты применяются в некоторых системах дистанционного обучения и при аттестации персонала, но широкого распространения в государственных экзаменах (например, ЕГЭ) пока не получили из-за технических и организационных ограничений.
¶Принцип работы
¶Алгоритм
Процесс компьютерного адаптивного тестирования состоит из нескольких этапов:
- Начальная оценка. Тест начинается с задания средней сложности (или с вопроса, выбранного на основе априорной информации об испытуемом, например, по его предыдущим результатам).
- Предъявление задания. Испытуемый отвечает на вопрос.
- Обновление оценки. На основе ответа (правильный/неправильный) алгоритм пересчитывает текущую оценку уровня способности (θ) с использованием модели IRT. Обычно применяется метод максимального правдоподобия или байесовский подход.
- Выбор следующего задания. Из банка заданий выбирается вопрос, который максимизирует информативность для текущей оценки — то есть задание, сложность которого наиболее близка к текущему уровню испытуемого. Это обеспечивает максимальную точность измерения.
- Проверка критерия остановки. Тест завершается, когда достигается заранее заданная точность оценки (например, стандартная ошибка измерения ниже порога) или когда исчерпан лимит вопросов. В некоторых системах также используется фиксированная длина теста, но адаптивный выбор заданий всё равно повышает точность.
¶Математическая модель
Наиболее распространённая модель — трёхпараметрическая логистическая модель (3PL) из IRT. Вероятность правильного ответа на задание j для испытуемого с уровнем способности θ задаётся формулой:
\[ P_j(\theta) = c_j + \frac{1 - c_j}{1 + e^{-a_j(\theta - b_j)}} \]
где:
- \( b_j \) — параметр сложности (чем выше, тем задание сложнее),
- \( a_j \) — параметр дискриминативности (чувствительность задания к различиям в способностях),
- \( c_j \) — параметр угадывания (вероятность правильного ответа при нулевой способности).
Алгоритм CAT использует эту модель для вычисления информационной функции задания и выбора наиболее информативного вопроса.
¶Классификация
Компьютерные адаптивные тесты можно классифицировать по нескольким признакам:
- По типу адаптации: фиксированная длина (все испытуемые проходят одинаковое количество вопросов, но разной сложности) и переменная длина (тест заканчивается при достижении заданной точности).
- По стратегии выбора заданий: случайный выбор из банка, максимизация информации, байесовский подход, многоэтапное тестирование (например, сначала предъявляется блок заданий, затем адаптация).
- По области применения: образовательные (оценка знаний), психологические (личностные опросники, интеллектуальные тесты), профессиональные (сертификация, отбор персонала), медицинские (диагностика когнитивных нарушений).
¶Преимущества и недостатки
¶Преимущества
- Эффективность. Для достижения той же точности, что и в традиционном тесте, требуется на 30–50 % меньше вопросов. Это снижает время тестирования и утомляемость испытуемых.
- Точность. Адаптивные тесты обеспечивают более точную оценку способностей, особенно на краях шкалы (очень низкие и очень высокие способности), где традиционные тесты часто дают большие ошибки.
- Безопасность. Поскольку каждый испытуемый получает уникальный набор заданий, вероятность списывания или утечки вопросов снижается.
- Индивидуализация. Тест подстраивается под уровень испытуемого, что делает процесс более комфортным: сильные студенты не тратят время на лёгкие вопросы, слабые — не сталкиваются с непосильными.
¶Недостатки
- Сложность разработки. Требуется большой банк заданий (обычно от нескольких сотен до тысяч), каждый из которых должен быть откалиброван по модели IRT. Это дорого и трудоёмко.
- Технические требования. Необходимо надёжное компьютерное оборудование и программное обеспечение, способное в реальном времени вычислять оценки и выбирать задания.
- Проблемы с валидностью. Если модель IRT неадекватна данным или банк заданий содержит плохие вопросы, результаты могут быть искажены. Также адаптивные тесты чувствительны к эффекту угадывания и мотивации испытуемых.
- Ограничения для некоторых групп. Люди с низкой компьютерной грамотностью или тревожностью могут показывать худшие результаты, чем при бумажном тестировании.
¶Применение
Компьютерные адаптивные тесты широко используются в различных сферах:
- Образование: международные экзамены (TOEFL iBT, GRE, GMAT), национальные тесты (например, в США — NCLEX для медсестёр, в Австралии — NAPLAN), системы дистанционного обучения (Moodle, Blackboard с плагинами CAT).
- Психология: тесты интеллекта (например, адаптивная версия теста Равена), личностные опросники (MMPI-2 в адаптивной форме), оценка когнитивных функций.
- Медицина: скрининг деменции, оценка боли, диагностика депрессии (например, PROMIS — Patient-Reported Outcomes Measurement Information System).
- Профессиональная сертификация: экзамены для бухгалтеров (CPA), инженеров, IT-специалистов (например, Cisco, Microsoft).
- Военные и государственные структуры: отбор и оценка персонала, тестирование на знание языков.
¶Примеры
- GRE (Graduate Record Examination) — адаптивный тест для поступления в аспирантуру в США. Вербальный и количественный разделы являются многоэтапными адаптивными: испытуемый проходит блоки заданий, и сложность следующего блока зависит от результатов предыдущего.
- TOEFL iBT (Test of English as a Foreign Language) — адаптивный тест на знание английского языка. Раздел «Чтение» и «Аудирование» адаптивны по длине, но не по сложности (все задания из одного банка). Раздел «Говорение» и «Письмо» не адаптивны.
- GMAT (Graduate Management Admission Test) — полностью адаптивный тест для поступления в бизнес-школы. Каждый вопрос выбирается в реальном времени на основе предыдущих ответов.
- NCLEX (National Council Licensure Examination) — адаптивный тест для лицензирования медсестёр в США и Канаде. Тест заканчивается, когда алгоритм с 95 % уверенностью определяет, что испытуемый сдал или провалил экзамен.
¶Критика
Основные критические замечания в адрес компьютерных адаптивных тестов касаются их справедливости и прозрачности. Поскольку алгоритм выбора заданий неочевиден для испытуемого, может возникнуть ощущение несправедливости, особенно если тест заканчивается раньше, чем ожидалось. Кроме того, адаптивные тесты требуют постоянного обновления банка заданий, чтобы избежать утечек и «натаскивания» на конкретные вопросы. Некоторые исследователи отмечают, что модели IRT, лежащие в основе CAT, могут быть неадекватны для сложных многомерных конструктов (например, творческих способностей). В России адаптивные тесты пока не получили широкого распространения в государственных системах оценки из-за высокой стоимости разработки и необходимости сертификации.
¶Интересные факты
- Первый компьютерный адаптивный тест был реализован в 1970-х годах для оценки знаний военнослужащих США (проект CAT-ASVAB).
- В 2010-х годах адаптивные тесты начали внедряться в мобильные приложения для самооценки знаний (например, Duolingo English Test).
- Некоторые системы CAT используют машинное обучение для улучшения выбора заданий, но классические модели IRT остаются стандартом.
¶Источники
- Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems. Lawrence Erlbaum Associates.
- Wainer, H. (2000). Computerized Adaptive Testing: A Primer (2nd ed.). Lawrence Erlbaum Associates.
- Van der Linden, W. J., & Glas, C. A. W. (2010). Elements of Adaptive Testing. Springer.
- Weiss, D. J. (1982). "Improving Measurement Quality and Efficiency with Adaptive Testing". Applied Psychological Measurement, 6(4), 473–492.
- Официальные материалы Educational Testing Service (ETS) по GRE и TOEFL.
- Статья «Компьютерное адаптивное тестирование» в Большой российской энциклопедии (2020).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


