Внутренняя валидность
Внутренняя валидность — это степень, в которой результаты экспериментального исследования могут быть объяснены именно воздействием независимой переменной, а не действием посторонних, неконтролируемых факторов. Иными словами, это мера достоверности причинно-следственной связи, устанавливаемой в исследовании: насколько уверенно можно утверждать, что изменения в зависимой переменной вызваны именно изменениями в независимой переменной, а не чем-то иным. Высокая внутренняя валидность является необходимым условием для любого эксперимента, претендующего на выявление причинно-следственных отношений.
История понятия
Термин «внутренняя валидность» был введён в научный оборот американскими психологами Дональдом Кэмпбеллом и Джулианом Стэнли в 1963 году в их классической работе «Экспериментальные и квазиэкспериментальные планы для исследований» (Experimental and Quasi-Experimental Designs for Research). Кэмпбелл и Стэнли разработали систематическую классификацию угроз внутренней валидности, которая до сих пор остаётся основой для планирования и критики экспериментальных исследований в социальных, поведенческих и медицинских науках. В последующие десятилетия концепция была уточнена и расширена, в том числе в работах Томаса Кука и самого Кэмпбелла, которые выделили также внешнюю валидность (возможность обобщения результатов на другие популяции, условия и времена) и другие виды валидности.
Угрозы внутренней валидности
Кэмпбелл и Стэнли описали восемь основных классов факторов, которые могут подрывать внутреннюю валидность эксперимента, выдавая ложные причинно-следственные связи. Эти угрозы необходимо контролировать или минимизировать при планировании исследования.
История (History)
Под «историей» понимаются любые события, происходящие между первым и вторым замерами (претестом и посттестом) в эксперименте, которые могут повлиять на зависимую переменную. Например, если в ходе исследования эффективности новой методики обучения в стране произошла реформа образования, изменения в результатах тестов могут быть связаны не с методикой, а с внешними событиями.
Созревание (Maturation)
Изменения в испытуемых, происходящие с течением времени естественным образом (взросление, утомление, голод, старение), могут быть ошибочно приняты за эффект экспериментального воздействия. В длительных исследованиях, особенно с детьми или пожилыми людьми, этот фактор особенно значим.
Эффект тестирования (Testing)
Само по себе прохождение претеста может повлиять на результаты посттеста. Испытуемые могут запомнить вопросы, научиться решать задачи определённого типа или просто привыкнуть к процедуре тестирования, что исказит оценку воздействия.
Инструментарий (Instrumentation)
Изменения в измерительном инструменте (например, смена наблюдателя, калибровка прибора, изменение критериев оценки) между претестом и посттестом могут создать иллюзию изменений в зависимой переменной. Если один ассистент проводит претест, а другой — посттест, различия в их манере общения могут повлиять на ответы испытуемых.
Статистическая регрессия (Statistical Regression)
Это явление, при котором испытуемые, отобранные на основе крайних (очень высоких или очень низких) показателей, при повторном измерении с высокой вероятностью покажут результаты, более близкие к среднему значению популяции. Регрессия к среднему может быть ошибочно истолкована как эффект воздействия, особенно в исследованиях с группами, отобранными по экстремальным признакам.
Отбор (Selection)
Систематические различия между экспериментальной и контрольной группами до начала эксперимента могут привести к искажению результатов. Если группы формируются неслучайно, различия в посттесте могут быть следствием исходных различий, а не воздействия.
Отсев (Mortality / Attrition)
Неравномерное выбывание участников из экспериментальной и контрольной групп в ходе исследования. Если из экспериментальной группы выбывают, например, наименее мотивированные участники, оставшиеся покажут лучшие результаты, что может быть ошибочно приписано воздействию.
Взаимодействие факторов отбора с другими угрозами (Selection-Maturation Interaction и др.)
Комбинация неэквивалентности групп с другими угрозами (например, с созреванием или историей). Например, если в экспериментальной группе собраны более молодые участники, чем в контрольной, то их более быстрое естественное развитие (созревание) может быть ошибочно принято за эффект воздействия.
Способы повышения внутренней валидности
Для минимизации угроз внутренней валидности исследователи применяют ряд процедурных и статистических методов.
Рандомизация
Случайное распределение испытуемых по экспериментальной и контрольной группам является наиболее мощным средством контроля за угрозами отбора и их взаимодействий. При достаточном объёме выборки рандомизация обеспечивает статистическую эквивалентность групп по всем известным и неизвестным переменным.
Контрольная группа
Наличие группы, не подвергающейся экспериментальному воздействию, позволяет отделить эффект воздействия от эффектов истории, созревания и тестирования, которые действуют на обе группы одинаково.
«Слепые» и «двойные слепые» методы
В исследованиях, особенно в медицине и психологии, испытуемые и/или экспериментаторы не знают, к какой группе (экспериментальной или контрольной) относится участник. Это предотвращает эффекты ожидания и субъективные искажения, угрожающие валидности.
Стандартизация процедур
Однотипное проведение всех этапов эксперимента (инструкции, время, условия, измерительные инструменты) для всех участников снижает риск влияния инструментария.
Использование планов с претестом и посттестом (Pretest-Posttest Design)
Измерение зависимой переменной до и после воздействия позволяет оценить динамику изменений, но требует контроля за эффектом тестирования и регрессией. Альтернативой является план только с посттестом (Posttest-Only Design) при условии качественной рандомизации.
Статистический контроль
В квазиэкспериментальных планах, где рандомизация невозможна, используются методы статистического уравнивания групп, такие как ковариационный анализ (ANCOVA), который позволяет скорректировать посттестовые результаты с учётом исходных различий по претесту.
Внутренняя валидность в различных типах исследований
Экспериментальные исследования
В истинных экспериментах с рандомизацией и контрольной группой внутренняя валидность потенциально наиболее высока, так как позволяет контролировать большинство угроз. Однако она не гарантируется автоматически и требует тщательного планирования.
Квазиэкспериментальные исследования
В исследованиях, где рандомизация невозможна (например, при изучении эффектов образовательной реформы в разных школах), внутренняя валидность ниже. Исследователи вынуждены полагаться на статистические методы и тщательный анализ альтернативных объяснений.
Корреляционные исследования
Корреляционные исследования, как правило, имеют низкую внутреннюю валидность, так как не позволяют установить причинно-следственную связь из-за проблемы третьей переменной и направления связи. Они могут лишь выявить наличие и силу взаимосвязи между переменными.
Качественные исследования
В качественных подходах (например, кейс-стади, этнография) концепция внутренней валидности часто переосмысливается. Вместо строгого контроля за переменными акцент делается на достоверности, убедительности и глубине интерпретации, а также на триангуляции данных (сравнении информации из разных источников).
Критика и ограничения
Концепция внутренней валидности, особенно в её классической формулировке Кэмпбелла и Стэнли, подвергалась критике. Некоторые исследователи, особенно в рамках качественной парадигмы, утверждают, что жёсткое требование внутренней валидности основано на позитивистской модели науки и не всегда применимо к изучению сложных социальных и психологических феноменов. Кроме того, чрезмерная сосредоточенность на внутренней валидности может привести к созданию искусственных лабораторных условий, которые имеют низкую внешнюю валидность (экологическую валидность), то есть результаты трудно перенести на реальные жизненные ситуации. Таким образом, исследователи часто сталкиваются с компромиссом между внутренней и внешней валидностью.
Значение
Внутренняя валидность является фундаментальным критерием качества экспериментального исследования. Без неё любые выводы о причинно-следственных связях остаются спекулятивными. Оценка внутренней валидности — обязательный элемент рецензирования научных статей и планирования диссертационных исследований в психологии, медицине, педагогике, экономике и других дисциплинах, использующих экспериментальные методы.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →