Открыть сервис

Эдинбургский ассоциативный тезаурус

Эдинбургский ассоциативный тезаурус (англ. Edinburgh Associative Thesaurus, EAT) — это лексикографическая база данных, представляющая собой набор ассоциативных норм для английского языка, собранных в ходе масштабного психолингвистического эксперимента в Эдинбургском университете в 1970-х годах. Тезаурус фиксирует реакции носителей языка на слова-стимулы и служит инструментом для изучения семантических связей, когнитивных процессов и организации лексикона в сознании человека.

История создания

Проект по созданию Эдинбургского ассоциативного тезауруса был инициирован в 1970 году группой исследователей под руководством Джорджа Киссена (George Kiss) и Кристофера Армстронга (Christopher Armstrong) на кафедре психологии Эдинбургского университета. Основной целью было получение эмпирических данных о том, как слова в английском языке связаны между собой в сознании носителей, и создание репрезентативной базы для психолингвистических и компьютерных исследований.

Сбор данных проводился с 1970 по 1973 год. В эксперименте приняли участие около 6500 добровольцев, преимущественно студентов и сотрудников Эдинбургского университета, а также жителей Шотландии. Каждому участнику предъявлялся список из 100 слов-стимулов, на которые требовалось дать первое пришедшее в голову слово-реакцию. Время на ответ не ограничивалось, но фиксировалось. Всего было собрано около 1,5 миллиона пар «стимул — реакция».

В 1975 году был опубликован первый печатный вариант тезауруса, содержащий данные по 8400 словам-стимулам. В 1990-х годах база была оцифрована и стала доступна онлайн. С тех пор EAT используется в лингвистике, психологии, искусственном интеллекте и компьютерной лексикографии.

Структура и содержание

Слова-стимулы

В тезаурус включено 8400 слов-стимулов, отобранных из частотных словарей английского языка. Стимулы представляют собой:

  • существительные (около 60%),
  • глаголы (около 20%),
  • прилагательные (около 15%),
  • служебные части речи (предлоги, союзы, местоимения — около 5%).

Каждое слово-стимул сопровождается списком реакций, упорядоченных по частоте встречаемости среди участников эксперимента. Для каждой реакции указывается абсолютное количество ответов и процент от общего числа ответов на данный стимул.

Ассоциативные нормы

Основной единицей данных является ассоциативная пара «стимул — реакция». Для каждой пары фиксируются:

  • слово-стимул,
  • слово-реакция,
  • частота реакции (количество участников, давших такой ответ),
  • ранг реакции (порядковый номер по убыванию частоты).

Пример для стимула «cat» (кошка):

  • dog (собака) — 45%,
  • animal (животное) — 12%,
  • mouse (мышь) — 8%,
  • pet (домашнее животное) — 5%,
  • и т.д.

Типы ассоциативных связей

На основе анализа реакций были выделены основные типы семантических отношений между стимулом и реакцией:

  • парадигматические (кошка — собака, стол — стул),
  • синтагматические (кошка — мяукает, стол — деревянный),
  • тематические (кошка — молоко, стол — обед),
  • фонетические (кошка — мошка, стол — стул),
  • эмоционально-оценочные (кошка — милая, стол — удобный).

Методология сбора данных

Процедура эксперимента

Эксперимент проводился в форме анкетирования. Каждому участнику выдавался бланк с 100 словами-стимулами, расположенными в случайном порядке. Участникам давалась инструкция: «Напишите первое слово, которое приходит вам в голову при чтении каждого слова-стимула». Ответы записывались вручную. Время на заполнение анкеты не ограничивалось, но среднее время составляло около 15–20 минут.

Контроль качества

Для минимизации случайных и нерелевантных ответов применялись следующие меры:

  • исключение из анализа ответов, не являющихся словами (например, междометия, звукоподражания),
  • отбраковка анкет, в которых более 10% ответов были пустыми или повторяющимися,
  • удаление реакций, встречающихся менее 5 раз (для статистической значимости).

Применение

Психолингвистика

EAT широко используется для изучения организации ментального лексикона — того, как слова хранятся и связываются в памяти человека. Данные тезауруса позволяют строить модели семантических сетей и анализировать, какие типы связей (синонимия, антонимия, родо-видовые отношения) преобладают в сознании носителей языка.

Компьютерная лингвистика

В области обработки естественного языка (NLP) EAT применяется для:

  • построения семантических векторов слов,
  • разрешения лексической многозначности,
  • создания тезаурусов для машинного перевода,
  • обучения моделей Word2Vec и GloVe (как эталон для оценки качества векторных представлений).

Психология и нейронауки

Ассоциативные нормы EAT используются в экспериментах по изучению памяти, внимания и восприятия. Например, при исследовании эффекта семантического прайминга (ускорения реакции на слово, если ему предшествует семантически связанное слово) данные EAT служат для подбора стимульного материала.

Лексикография

Тезаурус применяется для:

  • составления ассоциативных словарей,
  • разработки учебных материалов для изучающих английский язык,
  • анализа культурных стереотипов (например, какие реакции на слово «family» (семья) преобладают у носителей английского языка).

Критика и ограничения

Культурная и временная ограниченность

Данные EAT были собраны в 1970-х годах среди преимущественно молодых, образованных жителей Шотландии. Это накладывает ограничения на репрезентативность: ассоциации могут не отражать современное состояние языка и не учитывать диалектные, возрастные или социальные различия. Например, реакции на слово «computer» (компьютер) в 1970-х были связаны с «машина» или «расчет», а сегодня — с «интернет» или «игра».

Отсутствие контекста

Эксперимент проводился вне контекста, что не учитывает полисемию (многозначность) слов. Например, слово «bank» (банк/берег) может давать разные реакции в зависимости от того, какое значение активируется у участника.

Статистические ограничения

Несмотря на большой объем данных, для некоторых слов-стимулов количество реакций невелико (менее 100), что снижает статистическую надежность. Кроме того, метод свободных ассоциаций не позволяет выявить все возможные семантические связи — только наиболее сильные и частотные.

Сравнение с другими ассоциативными тезаурусами

ТезаурусГодЯзыкКоличество стимуловКоличество участников
EAT1975Английский84006500
USF Free Association Norms (Нельсон и др.)1998Английский50196000
Русский ассоциативный тезаурус (Караулов и др.)1994Русский12775000
Small World of Words (Стеварт и др.)2017Многоязычный10000+100000+

EAT остается одним из старейших и наиболее цитируемых ассоциативных тезаурусов, однако уступает более современным проектам по объему и охвату.

Интересные факты

  • Данные EAT использовались при разработке первой версии системы машинного перевода SYSTRAN в 1980-х годах.
  • В 2010 году база EAT была интегрирована в проект WordNet, что позволило обогатить семантическую сеть ассоциативными связями.
  • Некоторые реакции из EAT стали мемами в научном сообществе: например, на стимул «psychology» (психология) самой частой реакцией было «Freud» (Фрейд).

Источники

  • Kiss, G. R., Armstrong, C., Milroy, R., & Piper, J. (1973). An associative thesaurus of English and its computer analysis. In A. J. Aitken, R. W. Bailey, & N. Hamilton-Smith (Eds.), The computer and literary studies. Edinburgh University Press.
  • Nelson, D. L., McEvoy, C. L., & Schreiber, T. A. (1998). The University of South Florida word association, rhyme, and word fragment norms. Behavior Research Methods, Instruments, & Computers, 30(3), 413–427.
  • Караулов, Ю. Н., Сорокин, Ю. А., Тарасов, Е. Ф., & Уфимцева, Н. В. (1994). Русский ассоциативный словарь. М.: ИЯ РАН.
  • Steyvers, M., & Tenenbaum, J. B. (2005). The large-scale structure of semantic networks: Statistical analyses and a model of semantic growth. Cognitive Science, 29(1), 41–78.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →