Открыть сервис

Психометрические свойства

Психометрические свойства — это совокупность характеристик психологических измерительных инструментов (тестов, опросников, шкал), определяющих качество, надёжность и обоснованность получаемых с их помощью данных. Психометрические свойства оценивают, насколько точно и последовательно методика измеряет заявленные психические свойства (способности, черты личности, состояния, установки) и насколько результаты соответствуют теоретическим представлениям об измеряемом конструкте. Основными психометрическими свойствами являются надёжность, валидность, дискриминативность, репрезентативность норм и стандартизация процедуры.

История развития психометрических свойств

Понятие психометрических свойств сформировалось в рамках психометрики — научной дисциплины, занимающейся теорией и практикой измерения психических явлений. Первые попытки количественной оценки психологических характеристик относятся к концу XIX века, когда Фрэнсис Гальтон и Джеймс Маккин Кеттелл разрабатывали тесты на сенсомоторные способности. Однако систематическое изучение психометрических свойств началось в начале XX века с работами Альфреда Бине и Теодора Симона, создавшими первую шкалу интеллекта (1905 год). Бине ввёл понятие умственного возраста и заложил основы критериальной валидности.

В 1910-х — 1920-х годах Чарльз Спирмен разработал теорию надёжности тестов, введя понятие коэффициента надёжности и метода расщепления (split-half). В 1930-х годах Ли Кронбах предложил коэффициент альфа (α-Кронбаха) для оценки внутренней согласованности. В 1950-х годах концепция валидности была детализирована в работах Роберта Торндайка и Ли Кронбаха, выделивших содержательную, критериальную и конструктную валидность. В 1960-х — 1970-х годах развитие факторного анализа (Луис Терстоун, Рэймонд Кеттелл) позволило оценивать структурную валидность. В России вклад в развитие психометрических свойств внесли Л. С. Выготский (идея «зоны ближайшего развития»), А. Н. Леонтьев, Б. М. Теплов (дифференциальная психофизиология), а также В. Д. Небылицын и В. С. Мерлин.

Основные психометрические свойства

Надёжность

Надёжность — это устойчивость результатов теста при повторных измерениях, а также внутренняя согласованность его пунктов. Надёжность показывает, в какой степени результаты свободны от случайных ошибок измерения. Выделяют несколько видов надёжности:

  • Ретестовая надёжность — степень совпадения результатов при повторном тестировании одной и той же выборки через определённый интервал времени. Коэффициент ретестовой надёжности (корреляция Пирсона между двумя тестированиями) должен быть не ниже 0,7–0,8.
  • Надёжность по внутренней согласованности — оценивается с помощью коэффициента α-Кронбаха (для дихотомических пунктов — KR-20). Значение α ≥ 0,7 считается приемлемым, ≥ 0,9 — высоким.
  • Надёжность параллельных форм — корреляция между результатами двух эквивалентных версий теста.
  • Надёжность расщепления (split-half) — корреляция между результатами по чётным и нечётным пунктам теста.
  • Надёжность экспертов (inter-rater reliability) — согласованность оценок разных экспертов (коэффициент каппа Коэна).

Валидность

Валидность — это степень соответствия результатов теста измеряемому конструкту. Валидность показывает, что именно измеряет тест и насколько хорошо. Выделяют три основных типа валидности:

  • Содержательная валидность — насколько пункты теста охватывают все аспекты измеряемого конструкта. Оценивается экспертами (метод «дельфи»).
  • Критериальная валидность — корреляция результатов теста с внешним критерием (например, успеваемостью, профессиональной успешностью). Делится на текущую (конкурентную) и прогностическую.
  • Конструктная валидность — насколько результаты теста соответствуют теоретической модели конструкта. Оценивается через конвергентную (сходство с другими тестами на тот же конструкт) и дискриминантную (отличие от тестов на другие конструкты) валидность. Используется факторный анализ и метод известных групп.

Дискриминативность

Дискриминативность (различительная способность) — это способность теста дифференцировать испытуемых по уровню выраженности измеряемого свойства. Оценивается через индекс дискриминативности (разность процентов правильных ответов в верхней и нижней группах) или точечно-бисериальный коэффициент корреляции. Для пунктов теста приемлемым считается индекс дискриминативности ≥ 0,3.

Репрезентативность норм

Репрезентативность норм — это степень соответствия выборки стандартизации генеральной совокупности, для которой предназначен тест. Нормы (средние значения, процентили, стены) должны быть получены на репрезентативной выборке, отражающей возрастные, половые, социальные, региональные характеристики популяции. В России стандартизация тестов часто проводится на выборках студентов, что ограничивает репрезентативность.

Стандартизация

Стандартизация — это единообразие процедуры проведения, обработки и интерпретации результатов теста. Включает фиксированную инструкцию, временные ограничения, условия тестирования, правила подсчёта баллов и таблицы норм. Отсутствие стандартизации снижает надёжность и валидность.

Методы оценки психометрических свойств

Классическая теория тестов (CTT)

Классическая теория тестов (Classical Test Theory, CTT) — это традиционный подход, основанный на модели наблюдаемого балла как суммы истинного балла и случайной ошибки. В рамках CTT рассчитываются:

  • Коэффициент надёжности (α-Кронбаха, KR-20, ретестовая корреляция).
  • Индексы трудности и дискриминативности пунктов.
  • Корреляции с критериями (критериальная валидность).
  • Факторный анализ (конструктная валидность).

Недостатки CTT: зависимость оценок от выборки и длины теста, невозможность сравнения испытуемых на разных уровнях способности.

Теория айтрем-ответа (IRT)

Теория айтрем-ответа (Item Response Theory, IRT) — современный подход, моделирующий вероятность правильного ответа как функцию от уровня латентной черты испытуемого и параметров пункта (трудность, дискриминативность, вероятность угадывания). IRT позволяет:

  • Создавать адаптивные тесты (CAT — Computerized Adaptive Testing).
  • Оценивать информационную функцию теста (насколько тест точен на разных уровнях способности).
  • Сравнивать параметры пунктов и способности на одной шкале (метод Рэша).

IRT широко используется в международных исследованиях (PISA, TIMSS) и в тестировании интеллекта (шкала Векслера, тест Равена).

Применение психометрических свойств

Психометрические свойства используются в следующих областях:

  • Клиническая психология — диагностика психических расстройств (MMPI, тест Спилбергера-Ханина, шкала депрессии Бека). Валидность и надёжность критически важны для постановки диагноза.
  • Образование — оценка знаний, способностей и личностных качеств учащихся (ЕГЭ, тесты интеллекта, опросники мотивации). В России стандартизация тестов проводится в рамках Федерального института педагогических измерений (ФИПИ).
  • Профессиональный отбор — оценка профессионально важных качеств (тест Кеттелла, опросник MBTI, тесты на когнитивные способности). Валидность критериев (прогноз успешности) — ключевой показатель.
  • Спортивная психология — оценка психологической готовности спортсменов (опросник САН, тест Люшера).
  • Научные исследования — проверка гипотез о структуре личности, способностей, состояний. Психометрические свойства обеспечивают воспроизводимость результатов.

Критика и ограничения

Психометрические свойства не являются абсолютными. Критика включает:

  • Зависимость от выборки — надёжность и валидность могут различаться на разных популяциях (например, тесты, стандартизированные на американских студентах, могут быть невалидны для российских пенсионеров).
  • Культурная обусловленность — многие тесты имеют культурные и языковые искажения (например, тесты интеллекта, разработанные в западной культуре, могут недооценивать способности представителей других культур).
  • Недостаточная учёт контекста — результаты теста могут зависеть от мотивации, утомления, социальной желательности, что не всегда учитывается в психометрических моделях.
  • Проблема «психометрического парадокса» — высокая надёжность не гарантирует высокую валидность, и наоборот.
  • Этические аспекты — использование тестов с низкой валидностью для принятия решений (например, при приёме на работу или постановке диагноза) может приводить к дискриминации.

Перспективы развития

Современные тенденции в психометрике включают:

  • Разработку компьютеризированных адаптивных тестов (CAT) на основе IRT, позволяющих сократить время тестирования и повысить точность.
  • Использование методов машинного обучения для оценки психометрических свойств (например, классификация ответов на основе нейросетей).
  • Создание кросс-культурных тестов, адаптированных для разных стран и языков (например, PISA, TIMSS).
  • Интеграцию психометрических свойств с нейронаукой (нейропсихометрика) — оценка связи результатов тестов с активностью мозга (ЭЭГ, фМРТ).
  • Развитие «открытой психометрики» — публикация данных и кода для проверки психометрических свойств (репликационные исследования).

Источники

  1. Анастази А., Урбина С. Психологическое тестирование. — СПб.: Питер, 2007. — 688 с.
  2. Клайн П. Справочное руководство по конструированию тестов. — Киев: ПАН Лтд, 1994. — 288 с.
  3. Кронбах Л. Коэффициент альфа и внутренняя структура тестов // Психометрика. — 1951. — Т. 16, № 3. — С. 297–334.
  4. Лорд Ф. М., Новик М. Р. Статистические теории тестовых баллов. — М.: Педагогика, 1971. — 320 с.
  5. Мельников В. М., Ямпольский Л. Т. Введение в экспериментальную психологию личности. — М.: Просвещение, 1985. — 320 с.
  6. Носс И. Н. Психодиагностика: учебник для бакалавров. — М.: Юрайт, 2013. — 439 с.
  7. Равен Дж. К. Руководство к прогрессивным матрицам Равена. — М.: Когито-Центр, 2002. — 120 с.
  8. Торндайк Р. Л., Хаген Э. П. Измерение и оценка в психологии и образовании. — М.: Педагогика, 1974. — 320 с.
  9. Шмелёв А. Г. Психодиагностика личностных черт. — СПб.: Речь, 2002. — 480 с.
  10. Федеральный закон «Об образовании в Российской Федерации» от 29.12.2012 № 273-ФЗ (в части требований к педагогическим измерениям).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →