Психометрические свойства
Психометрические свойства — это совокупность характеристик психологических измерительных инструментов (тестов, опросников, шкал), определяющих качество, надёжность и обоснованность получаемых с их помощью данных. Психометрические свойства оценивают, насколько точно и последовательно методика измеряет заявленные психические свойства (способности, черты личности, состояния, установки) и насколько результаты соответствуют теоретическим представлениям об измеряемом конструкте. Основными психометрическими свойствами являются надёжность, валидность, дискриминативность, репрезентативность норм и стандартизация процедуры.
История развития психометрических свойств
Понятие психометрических свойств сформировалось в рамках психометрики — научной дисциплины, занимающейся теорией и практикой измерения психических явлений. Первые попытки количественной оценки психологических характеристик относятся к концу XIX века, когда Фрэнсис Гальтон и Джеймс Маккин Кеттелл разрабатывали тесты на сенсомоторные способности. Однако систематическое изучение психометрических свойств началось в начале XX века с работами Альфреда Бине и Теодора Симона, создавшими первую шкалу интеллекта (1905 год). Бине ввёл понятие умственного возраста и заложил основы критериальной валидности.
В 1910-х — 1920-х годах Чарльз Спирмен разработал теорию надёжности тестов, введя понятие коэффициента надёжности и метода расщепления (split-half). В 1930-х годах Ли Кронбах предложил коэффициент альфа (α-Кронбаха) для оценки внутренней согласованности. В 1950-х годах концепция валидности была детализирована в работах Роберта Торндайка и Ли Кронбаха, выделивших содержательную, критериальную и конструктную валидность. В 1960-х — 1970-х годах развитие факторного анализа (Луис Терстоун, Рэймонд Кеттелл) позволило оценивать структурную валидность. В России вклад в развитие психометрических свойств внесли Л. С. Выготский (идея «зоны ближайшего развития»), А. Н. Леонтьев, Б. М. Теплов (дифференциальная психофизиология), а также В. Д. Небылицын и В. С. Мерлин.
Основные психометрические свойства
Надёжность
Надёжность — это устойчивость результатов теста при повторных измерениях, а также внутренняя согласованность его пунктов. Надёжность показывает, в какой степени результаты свободны от случайных ошибок измерения. Выделяют несколько видов надёжности:
- Ретестовая надёжность — степень совпадения результатов при повторном тестировании одной и той же выборки через определённый интервал времени. Коэффициент ретестовой надёжности (корреляция Пирсона между двумя тестированиями) должен быть не ниже 0,7–0,8.
- Надёжность по внутренней согласованности — оценивается с помощью коэффициента α-Кронбаха (для дихотомических пунктов — KR-20). Значение α ≥ 0,7 считается приемлемым, ≥ 0,9 — высоким.
- Надёжность параллельных форм — корреляция между результатами двух эквивалентных версий теста.
- Надёжность расщепления (split-half) — корреляция между результатами по чётным и нечётным пунктам теста.
- Надёжность экспертов (inter-rater reliability) — согласованность оценок разных экспертов (коэффициент каппа Коэна).
Валидность
Валидность — это степень соответствия результатов теста измеряемому конструкту. Валидность показывает, что именно измеряет тест и насколько хорошо. Выделяют три основных типа валидности:
- Содержательная валидность — насколько пункты теста охватывают все аспекты измеряемого конструкта. Оценивается экспертами (метод «дельфи»).
- Критериальная валидность — корреляция результатов теста с внешним критерием (например, успеваемостью, профессиональной успешностью). Делится на текущую (конкурентную) и прогностическую.
- Конструктная валидность — насколько результаты теста соответствуют теоретической модели конструкта. Оценивается через конвергентную (сходство с другими тестами на тот же конструкт) и дискриминантную (отличие от тестов на другие конструкты) валидность. Используется факторный анализ и метод известных групп.
Дискриминативность
Дискриминативность (различительная способность) — это способность теста дифференцировать испытуемых по уровню выраженности измеряемого свойства. Оценивается через индекс дискриминативности (разность процентов правильных ответов в верхней и нижней группах) или точечно-бисериальный коэффициент корреляции. Для пунктов теста приемлемым считается индекс дискриминативности ≥ 0,3.
Репрезентативность норм
Репрезентативность норм — это степень соответствия выборки стандартизации генеральной совокупности, для которой предназначен тест. Нормы (средние значения, процентили, стены) должны быть получены на репрезентативной выборке, отражающей возрастные, половые, социальные, региональные характеристики популяции. В России стандартизация тестов часто проводится на выборках студентов, что ограничивает репрезентативность.
Стандартизация
Стандартизация — это единообразие процедуры проведения, обработки и интерпретации результатов теста. Включает фиксированную инструкцию, временные ограничения, условия тестирования, правила подсчёта баллов и таблицы норм. Отсутствие стандартизации снижает надёжность и валидность.
Методы оценки психометрических свойств
Классическая теория тестов (CTT)
Классическая теория тестов (Classical Test Theory, CTT) — это традиционный подход, основанный на модели наблюдаемого балла как суммы истинного балла и случайной ошибки. В рамках CTT рассчитываются:
- Коэффициент надёжности (α-Кронбаха, KR-20, ретестовая корреляция).
- Индексы трудности и дискриминативности пунктов.
- Корреляции с критериями (критериальная валидность).
- Факторный анализ (конструктная валидность).
Недостатки CTT: зависимость оценок от выборки и длины теста, невозможность сравнения испытуемых на разных уровнях способности.
Теория айтрем-ответа (IRT)
Теория айтрем-ответа (Item Response Theory, IRT) — современный подход, моделирующий вероятность правильного ответа как функцию от уровня латентной черты испытуемого и параметров пункта (трудность, дискриминативность, вероятность угадывания). IRT позволяет:
- Создавать адаптивные тесты (CAT — Computerized Adaptive Testing).
- Оценивать информационную функцию теста (насколько тест точен на разных уровнях способности).
- Сравнивать параметры пунктов и способности на одной шкале (метод Рэша).
IRT широко используется в международных исследованиях (PISA, TIMSS) и в тестировании интеллекта (шкала Векслера, тест Равена).
Применение психометрических свойств
Психометрические свойства используются в следующих областях:
- Клиническая психология — диагностика психических расстройств (MMPI, тест Спилбергера-Ханина, шкала депрессии Бека). Валидность и надёжность критически важны для постановки диагноза.
- Образование — оценка знаний, способностей и личностных качеств учащихся (ЕГЭ, тесты интеллекта, опросники мотивации). В России стандартизация тестов проводится в рамках Федерального института педагогических измерений (ФИПИ).
- Профессиональный отбор — оценка профессионально важных качеств (тест Кеттелла, опросник MBTI, тесты на когнитивные способности). Валидность критериев (прогноз успешности) — ключевой показатель.
- Спортивная психология — оценка психологической готовности спортсменов (опросник САН, тест Люшера).
- Научные исследования — проверка гипотез о структуре личности, способностей, состояний. Психометрические свойства обеспечивают воспроизводимость результатов.
Критика и ограничения
Психометрические свойства не являются абсолютными. Критика включает:
- Зависимость от выборки — надёжность и валидность могут различаться на разных популяциях (например, тесты, стандартизированные на американских студентах, могут быть невалидны для российских пенсионеров).
- Культурная обусловленность — многие тесты имеют культурные и языковые искажения (например, тесты интеллекта, разработанные в западной культуре, могут недооценивать способности представителей других культур).
- Недостаточная учёт контекста — результаты теста могут зависеть от мотивации, утомления, социальной желательности, что не всегда учитывается в психометрических моделях.
- Проблема «психометрического парадокса» — высокая надёжность не гарантирует высокую валидность, и наоборот.
- Этические аспекты — использование тестов с низкой валидностью для принятия решений (например, при приёме на работу или постановке диагноза) может приводить к дискриминации.
Перспективы развития
Современные тенденции в психометрике включают:
- Разработку компьютеризированных адаптивных тестов (CAT) на основе IRT, позволяющих сократить время тестирования и повысить точность.
- Использование методов машинного обучения для оценки психометрических свойств (например, классификация ответов на основе нейросетей).
- Создание кросс-культурных тестов, адаптированных для разных стран и языков (например, PISA, TIMSS).
- Интеграцию психометрических свойств с нейронаукой (нейропсихометрика) — оценка связи результатов тестов с активностью мозга (ЭЭГ, фМРТ).
- Развитие «открытой психометрики» — публикация данных и кода для проверки психометрических свойств (репликационные исследования).
Источники
- Анастази А., Урбина С. Психологическое тестирование. — СПб.: Питер, 2007. — 688 с.
- Клайн П. Справочное руководство по конструированию тестов. — Киев: ПАН Лтд, 1994. — 288 с.
- Кронбах Л. Коэффициент альфа и внутренняя структура тестов // Психометрика. — 1951. — Т. 16, № 3. — С. 297–334.
- Лорд Ф. М., Новик М. Р. Статистические теории тестовых баллов. — М.: Педагогика, 1971. — 320 с.
- Мельников В. М., Ямпольский Л. Т. Введение в экспериментальную психологию личности. — М.: Просвещение, 1985. — 320 с.
- Носс И. Н. Психодиагностика: учебник для бакалавров. — М.: Юрайт, 2013. — 439 с.
- Равен Дж. К. Руководство к прогрессивным матрицам Равена. — М.: Когито-Центр, 2002. — 120 с.
- Торндайк Р. Л., Хаген Э. П. Измерение и оценка в психологии и образовании. — М.: Педагогика, 1974. — 320 с.
- Шмелёв А. Г. Психодиагностика личностных черт. — СПб.: Речь, 2002. — 480 с.
- Федеральный закон «Об образовании в Российской Федерации» от 29.12.2012 № 273-ФЗ (в части требований к педагогическим измерениям).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →