Компьютерное адаптивное тестирование
Компьютерное адаптивное тестирование (англ. Computerized Adaptive Testing, CAT) — это форма тестирования, при которой предъявление заданий испытуемому происходит динамически, в зависимости от его ответов на предыдущие вопросы. В отличие от традиционных бумажных или линейных компьютерных тестов с фиксированным набором заданий, адаптивный тест подбирает каждое следующее задание, стремясь наиболее точно оценить уровень подготовленности испытуемого за минимальное время. Основой для работы CAT служит теория Item Response Theory (IRT) — теория моделирования латентных черт, которая математически связывает вероятность правильного ответа с уровнем способностей испытуемого и параметрами задания (сложность, дискриминативность, вероятность угадывания).
История
Идея адаптивного тестирования возникла в середине XX века, когда психометрики и педагоги осознали неэффективность тестов, одинаково сложных для всех участников. Первые теоретические разработки принадлежат Фредерику Лорду (Frederic Lord) и его коллегам из Службы образовательного тестирования (ETS, США). В 1970-х годах Лорд опубликовал фундаментальные работы по применению IRT для адаптивного тестирования, заложив математическую базу. Однако практическая реализация стала возможна только с развитием вычислительной техники.
В 1980-х годах появились первые экспериментальные системы, например, тест по математике для военнослужащих США (CAT-ASVAB). В 1990-х годах, с распространением персональных компьютеров, CAT начали внедрять в крупных образовательных и сертификационных программах: Graduate Record Examination (GRE) — с 1993 года, Test of English as a Foreign Language (TOEFL) — с 1998 года. В России адаптивное тестирование стало применяться позже, в основном в рамках единого государственного экзамена (ЕГЭ) в компьютерной форме, а также в системах дистанционного обучения и профессиональной сертификации (например, в некоторых тестах для медицинских работников).
Принцип работы
Процесс CAT состоит из нескольких этапов, повторяющихся циклически:
- Начальная оценка. Система задаёт первое задание. Обычно оно выбирается из середины шкалы сложности (например, с параметром сложности, близким к нулю в логистической шкале), либо на основе априорной информации об испытуемом (если она есть, например, из предыдущих тестов или демографических данных).
- Оценка уровня способностей. После каждого ответа система пересчитывает текущую оценку уровня подготовленности испытуемого (обычно обозначается как θ — тета). Для этого используются методы максимального правдоподобия или байесовского оценивания.
- Выбор следующего задания. На основе текущей оценки θ система выбирает из банка заданий то, которое предоставит максимальное количество информации для уточнения этой оценки. Критерием выбора часто служит максимизация информационной функции задания (Item Information Function) при текущем θ. Задания, которые испытуемый, скорее всего, решит правильно или неправильно с вероятностью, близкой к 100%, неинформативны — они не дают новых данных для дифференциации. Наиболее информативны задания, сложность которых соответствует текущему уровню испытуемого.
- Проверка критерия остановки. Процесс повторяется до тех пор, пока не будет выполнено одно из условий:
- Достигнута заданная точность оценки (стандартная ошибка измерения ниже порогового значения).
- Предъявлено максимальное количество заданий.
- Истекло отведённое время.
- Выдача результата. Итоговая оценка представляет собой финальное значение θ, которое может быть преобразовано в шкалированный балл (например, от 0 до 100 или от 200 до 800).
Математическая основа
Теория IRT, лежащая в основе CAT, обычно использует трёхпараметрическую логистическую модель (3PL):
\[ P(X=1|\theta) = c + \frac{1 - c}{1 + e^{-a(\theta - b)}} \]
Где:
- \(P(X=1|\theta)\) — вероятность правильного ответа испытуемого с уровнем способностей \(\theta\).
- \(\theta\) — уровень подготовленности испытуемого (латентная переменная).
- \(b\) — параметр сложности задания (значение \(\theta\), при котором вероятность правильного ответа равна \((1+c)/2\)).
- \(a\) — параметр дискриминативности (крутизна кривой; чем выше, тем лучше задание различает испытуемых разного уровня).
- \(c\) — параметр псевдоугадывания (нижняя асимптота; для заданий с выбором ответа).
Информационная функция задания (IIF) для модели 3PL показывает, насколько точно задание измеряет способности при данном \(\theta\). CAT выбирает задание с максимальной IIF на текущем этапе.
Классификация
Адаптивные тесты можно классифицировать по нескольким признакам:
- По типу адаптации:
- Двухстадийные (two-stage). Первая стадия — короткий фиксированный тест (рут-тест) для грубой оценки. Вторая стадия — один из нескольких вариантов теста разной сложности, выбранный на основе результата первой стадии.
- Многостадийные (multi-stage или multistage testing, MST). Испытуемый проходит последовательность модулей (пакетов заданий), каждый из которых выбирается на основе предыдущего результата. Более гибкий, чем двухстадийный, но менее динамичный, чем пошаговый.
- Пошаговые (item-by-item). Классический CAT, где каждое следующее задание выбирается индивидуально после каждого ответа. Наиболее точный, но требует мощного банка заданий и вычислительных ресурсов.
- По цели тестирования:
- Тесты достижений (achievement tests). Оценка знаний по конкретной дисциплине (например, GMAT, GRE Subject Tests).
- Тесты способностей (aptitude tests). Оценка общих или специальных когнитивных способностей (например, тесты IQ).
- Диагностические тесты (diagnostic tests). Выявление сильных и слабых сторон, пробелов в знаниях (например, в системах адаптивного обучения).
- Психологические тесты (personality tests). Измерение личностных черт (например, адаптивные версии MMPI).
Достоинства и недостатки
Достоинства
- Эффективность. CAT позволяет получить точную оценку уровня испытуемого за значительно меньшее количество заданий (на 30–50% меньше) по сравнению с линейным тестом. Это сокращает время тестирования и снижает утомляемость.
- Точность. Для каждого испытуемого оценка производится с заданной точностью, независимо от его уровня. Сильные и слабые участники получают одинаково надёжные результаты.
- Безопасность. Поскольку каждый испытуемый получает уникальный набор заданий (особенно при большом банке), списывание и утечка заданий затруднены. Задания могут быть предъявлены в случайном порядке.
- Мотивация. Испытуемые не сталкиваются с заданиями, которые слишком просты (скука) или слишком сложны (фрустрация). Задания подбираются под их уровень, что поддерживает вовлечённость.
Недостатки
- Сложность разработки. Создание банка заданий, калиброванных по IRT, требует больших затрат времени и ресурсов. Каждое задание должно быть предварительно протестировано на репрезентативной выборке.
- Вычислительная нагрузка. Алгоритмы CAT требуют постоянных вычислений (оценка θ, выбор задания, проверка критерия остановки), что накладывает требования к серверному оборудованию.
- Проблема «холодного старта». Начальная оценка может быть неточной, что приводит к выбору неоптимальных первых заданий. Для решения используются априорные распределения или специальные стартовые правила.
- Ограничения по содержанию. CAT может игнорировать некоторые темы, если задания по ним неинформативны для текущей оценки θ. Для обеспечения содержательной валидности используются методы контент-балансировки (content balancing), когда система принудительно включает задания из разных разделов.
- Необходимость большого банка заданий. Для эффективной работы CAT требуется банк из нескольких сотен или тысяч заданий, охватывающих весь диапазон сложности.
Применение
Компьютерное адаптивное тестирование широко используется в различных областях:
- Образование. Крупные международные и национальные экзамены: GRE, GMAT, TOEFL iBT, Praxis (для учителей в США), некоторые версии тестов PISA. В России — элементы CAT в рамках компьютерного ЕГЭ по информатике и в пилотных проектах.
- Профессиональная сертификация. Сертификационные экзамены в области IT (например, некоторые тесты Microsoft, Cisco), финансов (CFA, Series 7), медицины (USMLE Step 2 CK, NCLEX).
- Психологическое тестирование. Адаптивные версии тестов интеллекта (например, WAIS-IV), личностных опросников (NEO-PI-R). В России — некоторые методики в системах профотбора.
- Военное дело. Тесты для оценки профессиональных знаний и навыков военнослужащих (CAT-ASVAB, системы для ВВС и ВМС США).
- Адаптивное обучение. Системы, которые не только тестируют, но и подстраивают учебный материал под уровень ученика (например, платформы Khan Academy, ALEKS, Stepik). В таких системах CAT используется для диагностики и мониторинга прогресса.
Критика и ограничения
Основные критические замечания в адрес CAT связаны с потенциальной несправедливостью для некоторых групп испытуемых. Например, испытуемые с высоким уровнем тревожности могут хуже справляться с динамически меняющимися заданиями. Также существует проблема «эффекта порядка»: испытуемые, получившие в начале сложные задания, могут демотивироваться, даже если система быстро адаптируется. Кроме того, CAT требует от испытуемых базовых навыков работы с компьютером, что может создавать неравенство для лиц с ограниченными возможностями или из малообеспеченных регионов. Наконец, математическая сложность IRT и CAT может быть непрозрачна для конечных пользователей (учителей, студентов), что затрудняет интерпретацию результатов.
Интересные факты
- Первый полностью адаптивный тест, реализованный на компьютере, был разработан в 1970-х годах для отбора пилотов ВВС США.
- В банке заданий для GRE (Graduate Record Examination) содержится более 10 000 заданий, что делает практически невозможным повторение одного и того же набора.
- Некоторые современные системы CAT используют методы машинного обучения для улучшения выбора заданий, например, алгоритмы обучения с подкреплением (reinforcement learning).
Источники
- Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems. Hillsdale, NJ: Lawrence Erlbaum Associates.
- Wainer, H., Dorans, N. J., Flaugher, R., Green, B. F., & Mislevy, R. J. (2000). Computerized Adaptive Testing: A Primer (2nd ed.). Mahwah, NJ: Lawrence Erlbaum Associates.
- van der Linden, W. J., & Glas, C. A. W. (Eds.). (2010). Elements of Adaptive Testing. New York: Springer.
- Weiss, D. J. (1982). Improving measurement quality and efficiency with adaptive testing. Applied Psychological Measurement, 6(4), 473-492.
- Материалы Федерального института педагогических измерений (ФИПИ) по компьютерному ЕГЭ.
- Документация по системе ALEKS (Assessment and LEarning in Knowledge Spaces).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →