Открыть сервис

Компьютерные адаптивные тесты

Компьютерные адаптивные тесты (англ. Computerized Adaptive Testing, CAT) — это форма тестирования, при которой задания предъявляются испытуемому в зависимости от его предыдущих ответов, с целью оценки уровня знаний или способностей с максимальной точностью при минимальном количестве вопросов. В отличие от традиционных бланковых или компьютерных тестов с фиксированным набором заданий, адаптивные тесты динамически подбирают сложность и содержание каждого следующего вопроса, опираясь на текущую оценку уровня испытуемого. Основой для таких тестов служит математическая модель, чаще всего из теории вероятностей — теория тестирования (Item Response Theory, IRT), которая связывает вероятность правильного ответа с параметрами задания (сложность, дискриминативность, угадывание) и уровнем способности человека.

История

Идея адаптивного тестирования возникла в середине XX века, когда психометрики осознали недостатки традиционных тестов с фиксированной длиной. В 1950-х годах Фредерик Лорд (США) разработал основы теории IRT, которая позволила математически описывать поведение заданий и оценивать способности независимо от конкретного набора вопросов. Первые компьютерные адаптивные тесты стали возможны с появлением достаточно мощных компьютеров в 1970–1980-х годах. В 1984 году в США был запущен первый крупный проект CAT — Graduate Record Examination (GRE) в компьютерной версии, хотя полностью адаптивным он стал позже. В 1990-х годах адаптивные тесты начали внедряться в образовательное тестирование (например, TOEFL iBT, GMAT), а также в профессиональные сертификации (например, для медсестёр, инженеров). В России адаптивные тесты применяются в некоторых системах дистанционного обучения и при аттестации персонала, но широкого распространения в государственных экзаменах (например, ЕГЭ) пока не получили из-за технических и организационных ограничений.

Принцип работы

Алгоритм

Процесс компьютерного адаптивного тестирования состоит из нескольких этапов:

  1. Начальная оценка. Тест начинается с задания средней сложности (или с вопроса, выбранного на основе априорной информации об испытуемом, например, по его предыдущим результатам).
  2. Предъявление задания. Испытуемый отвечает на вопрос.
  3. Обновление оценки. На основе ответа (правильный/неправильный) алгоритм пересчитывает текущую оценку уровня способности (θ) с использованием модели IRT. Обычно применяется метод максимального правдоподобия или байесовский подход.
  4. Выбор следующего задания. Из банка заданий выбирается вопрос, который максимизирует информативность для текущей оценки — то есть задание, сложность которого наиболее близка к текущему уровню испытуемого. Это обеспечивает максимальную точность измерения.
  5. Проверка критерия остановки. Тест завершается, когда достигается заранее заданная точность оценки (например, стандартная ошибка измерения ниже порога) или когда исчерпан лимит вопросов. В некоторых системах также используется фиксированная длина теста, но адаптивный выбор заданий всё равно повышает точность.

Математическая модель

Наиболее распространённая модель — трёхпараметрическая логистическая модель (3PL) из IRT. Вероятность правильного ответа на задание j для испытуемого с уровнем способности θ задаётся формулой:

\[ P_j(\theta) = c_j + \frac{1 - c_j}{1 + e^{-a_j(\theta - b_j)}} \]

где:

  • \( b_j \) — параметр сложности (чем выше, тем задание сложнее),
  • \( a_j \) — параметр дискриминативности (чувствительность задания к различиям в способностях),
  • \( c_j \) — параметр угадывания (вероятность правильного ответа при нулевой способности).

Алгоритм CAT использует эту модель для вычисления информационной функции задания и выбора наиболее информативного вопроса.

Классификация

Компьютерные адаптивные тесты можно классифицировать по нескольким признакам:

  • По типу адаптации: фиксированная длина (все испытуемые проходят одинаковое количество вопросов, но разной сложности) и переменная длина (тест заканчивается при достижении заданной точности).
  • По стратегии выбора заданий: случайный выбор из банка, максимизация информации, байесовский подход, многоэтапное тестирование (например, сначала предъявляется блок заданий, затем адаптация).
  • По области применения: образовательные (оценка знаний), психологические (личностные опросники, интеллектуальные тесты), профессиональные (сертификация, отбор персонала), медицинские (диагностика когнитивных нарушений).

Преимущества и недостатки

Преимущества

  • Эффективность. Для достижения той же точности, что и в традиционном тесте, требуется на 30–50 % меньше вопросов. Это снижает время тестирования и утомляемость испытуемых.
  • Точность. Адаптивные тесты обеспечивают более точную оценку способностей, особенно на краях шкалы (очень низкие и очень высокие способности), где традиционные тесты часто дают большие ошибки.
  • Безопасность. Поскольку каждый испытуемый получает уникальный набор заданий, вероятность списывания или утечки вопросов снижается.
  • Индивидуализация. Тест подстраивается под уровень испытуемого, что делает процесс более комфортным: сильные студенты не тратят время на лёгкие вопросы, слабые — не сталкиваются с непосильными.

Недостатки

  • Сложность разработки. Требуется большой банк заданий (обычно от нескольких сотен до тысяч), каждый из которых должен быть откалиброван по модели IRT. Это дорого и трудоёмко.
  • Технические требования. Необходимо надёжное компьютерное оборудование и программное обеспечение, способное в реальном времени вычислять оценки и выбирать задания.
  • Проблемы с валидностью. Если модель IRT неадекватна данным или банк заданий содержит плохие вопросы, результаты могут быть искажены. Также адаптивные тесты чувствительны к эффекту угадывания и мотивации испытуемых.
  • Ограничения для некоторых групп. Люди с низкой компьютерной грамотностью или тревожностью могут показывать худшие результаты, чем при бумажном тестировании.

Применение

Компьютерные адаптивные тесты широко используются в различных сферах:

  • Образование: международные экзамены (TOEFL iBT, GRE, GMAT), национальные тесты (например, в США — NCLEX для медсестёр, в Австралии — NAPLAN), системы дистанционного обучения (Moodle, Blackboard с плагинами CAT).
  • Психология: тесты интеллекта (например, адаптивная версия теста Равена), личностные опросники (MMPI-2 в адаптивной форме), оценка когнитивных функций.
  • Медицина: скрининг деменции, оценка боли, диагностика депрессии (например, PROMIS — Patient-Reported Outcomes Measurement Information System).
  • Профессиональная сертификация: экзамены для бухгалтеров (CPA), инженеров, IT-специалистов (например, Cisco, Microsoft).
  • Военные и государственные структуры: отбор и оценка персонала, тестирование на знание языков.

Примеры

  • GRE (Graduate Record Examination) — адаптивный тест для поступления в аспирантуру в США. Вербальный и количественный разделы являются многоэтапными адаптивными: испытуемый проходит блоки заданий, и сложность следующего блока зависит от результатов предыдущего.
  • TOEFL iBT (Test of English as a Foreign Language) — адаптивный тест на знание английского языка. Раздел «Чтение» и «Аудирование» адаптивны по длине, но не по сложности (все задания из одного банка). Раздел «Говорение» и «Письмо» не адаптивны.
  • GMAT (Graduate Management Admission Test) — полностью адаптивный тест для поступления в бизнес-школы. Каждый вопрос выбирается в реальном времени на основе предыдущих ответов.
  • NCLEX (National Council Licensure Examination) — адаптивный тест для лицензирования медсестёр в США и Канаде. Тест заканчивается, когда алгоритм с 95 % уверенностью определяет, что испытуемый сдал или провалил экзамен.

Критика

Основные критические замечания в адрес компьютерных адаптивных тестов касаются их справедливости и прозрачности. Поскольку алгоритм выбора заданий неочевиден для испытуемого, может возникнуть ощущение несправедливости, особенно если тест заканчивается раньше, чем ожидалось. Кроме того, адаптивные тесты требуют постоянного обновления банка заданий, чтобы избежать утечек и «натаскивания» на конкретные вопросы. Некоторые исследователи отмечают, что модели IRT, лежащие в основе CAT, могут быть неадекватны для сложных многомерных конструктов (например, творческих способностей). В России адаптивные тесты пока не получили широкого распространения в государственных системах оценки из-за высокой стоимости разработки и необходимости сертификации.

Интересные факты

  • Первый компьютерный адаптивный тест был реализован в 1970-х годах для оценки знаний военнослужащих США (проект CAT-ASVAB).
  • В 2010-х годах адаптивные тесты начали внедряться в мобильные приложения для самооценки знаний (например, Duolingo English Test).
  • Некоторые системы CAT используют машинное обучение для улучшения выбора заданий, но классические модели IRT остаются стандартом.

Источники

  • Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems. Lawrence Erlbaum Associates.
  • Wainer, H. (2000). Computerized Adaptive Testing: A Primer (2nd ed.). Lawrence Erlbaum Associates.
  • Van der Linden, W. J., & Glas, C. A. W. (2010). Elements of Adaptive Testing. Springer.
  • Weiss, D. J. (1982). "Improving Measurement Quality and Efficiency with Adaptive Testing". Applied Psychological Measurement, 6(4), 473–492.
  • Официальные материалы Educational Testing Service (ETS) по GRE и TOEFL.
  • Статья «Компьютерное адаптивное тестирование» в Большой российской энциклопедии (2020).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →