Эдинбургский ассоциативный тезаурус
Эдинбургский ассоциативный тезаурус (англ. Edinburgh Associative Thesaurus, EAT) — это лексикографическая база данных, представляющая собой набор ассоциативных норм для английского языка, собранных в ходе масштабного психолингвистического эксперимента в Эдинбургском университете в 1970-х годах. Тезаурус фиксирует реакции носителей языка на слова-стимулы и служит инструментом для изучения семантических связей, когнитивных процессов и организации лексикона в сознании человека.
История создания
Проект по созданию Эдинбургского ассоциативного тезауруса был инициирован в 1970 году группой исследователей под руководством Джорджа Киссена (George Kiss) и Кристофера Армстронга (Christopher Armstrong) на кафедре психологии Эдинбургского университета. Основной целью было получение эмпирических данных о том, как слова в английском языке связаны между собой в сознании носителей, и создание репрезентативной базы для психолингвистических и компьютерных исследований.
Сбор данных проводился с 1970 по 1973 год. В эксперименте приняли участие около 6500 добровольцев, преимущественно студентов и сотрудников Эдинбургского университета, а также жителей Шотландии. Каждому участнику предъявлялся список из 100 слов-стимулов, на которые требовалось дать первое пришедшее в голову слово-реакцию. Время на ответ не ограничивалось, но фиксировалось. Всего было собрано около 1,5 миллиона пар «стимул — реакция».
В 1975 году был опубликован первый печатный вариант тезауруса, содержащий данные по 8400 словам-стимулам. В 1990-х годах база была оцифрована и стала доступна онлайн. С тех пор EAT используется в лингвистике, психологии, искусственном интеллекте и компьютерной лексикографии.
Структура и содержание
Слова-стимулы
В тезаурус включено 8400 слов-стимулов, отобранных из частотных словарей английского языка. Стимулы представляют собой:
- существительные (около 60%),
- глаголы (около 20%),
- прилагательные (около 15%),
- служебные части речи (предлоги, союзы, местоимения — около 5%).
Каждое слово-стимул сопровождается списком реакций, упорядоченных по частоте встречаемости среди участников эксперимента. Для каждой реакции указывается абсолютное количество ответов и процент от общего числа ответов на данный стимул.
Ассоциативные нормы
Основной единицей данных является ассоциативная пара «стимул — реакция». Для каждой пары фиксируются:
- слово-стимул,
- слово-реакция,
- частота реакции (количество участников, давших такой ответ),
- ранг реакции (порядковый номер по убыванию частоты).
Пример для стимула «cat» (кошка):
- dog (собака) — 45%,
- animal (животное) — 12%,
- mouse (мышь) — 8%,
- pet (домашнее животное) — 5%,
- и т.д.
Типы ассоциативных связей
На основе анализа реакций были выделены основные типы семантических отношений между стимулом и реакцией:
- парадигматические (кошка — собака, стол — стул),
- синтагматические (кошка — мяукает, стол — деревянный),
- тематические (кошка — молоко, стол — обед),
- фонетические (кошка — мошка, стол — стул),
- эмоционально-оценочные (кошка — милая, стол — удобный).
Методология сбора данных
Процедура эксперимента
Эксперимент проводился в форме анкетирования. Каждому участнику выдавался бланк с 100 словами-стимулами, расположенными в случайном порядке. Участникам давалась инструкция: «Напишите первое слово, которое приходит вам в голову при чтении каждого слова-стимула». Ответы записывались вручную. Время на заполнение анкеты не ограничивалось, но среднее время составляло около 15–20 минут.
Контроль качества
Для минимизации случайных и нерелевантных ответов применялись следующие меры:
- исключение из анализа ответов, не являющихся словами (например, междометия, звукоподражания),
- отбраковка анкет, в которых более 10% ответов были пустыми или повторяющимися,
- удаление реакций, встречающихся менее 5 раз (для статистической значимости).
Применение
Психолингвистика
EAT широко используется для изучения организации ментального лексикона — того, как слова хранятся и связываются в памяти человека. Данные тезауруса позволяют строить модели семантических сетей и анализировать, какие типы связей (синонимия, антонимия, родо-видовые отношения) преобладают в сознании носителей языка.
Компьютерная лингвистика
В области обработки естественного языка (NLP) EAT применяется для:
- построения семантических векторов слов,
- разрешения лексической многозначности,
- создания тезаурусов для машинного перевода,
- обучения моделей Word2Vec и GloVe (как эталон для оценки качества векторных представлений).
Психология и нейронауки
Ассоциативные нормы EAT используются в экспериментах по изучению памяти, внимания и восприятия. Например, при исследовании эффекта семантического прайминга (ускорения реакции на слово, если ему предшествует семантически связанное слово) данные EAT служат для подбора стимульного материала.
Лексикография
Тезаурус применяется для:
- составления ассоциативных словарей,
- разработки учебных материалов для изучающих английский язык,
- анализа культурных стереотипов (например, какие реакции на слово «family» (семья) преобладают у носителей английского языка).
Критика и ограничения
Культурная и временная ограниченность
Данные EAT были собраны в 1970-х годах среди преимущественно молодых, образованных жителей Шотландии. Это накладывает ограничения на репрезентативность: ассоциации могут не отражать современное состояние языка и не учитывать диалектные, возрастные или социальные различия. Например, реакции на слово «computer» (компьютер) в 1970-х были связаны с «машина» или «расчет», а сегодня — с «интернет» или «игра».
Отсутствие контекста
Эксперимент проводился вне контекста, что не учитывает полисемию (многозначность) слов. Например, слово «bank» (банк/берег) может давать разные реакции в зависимости от того, какое значение активируется у участника.
Статистические ограничения
Несмотря на большой объем данных, для некоторых слов-стимулов количество реакций невелико (менее 100), что снижает статистическую надежность. Кроме того, метод свободных ассоциаций не позволяет выявить все возможные семантические связи — только наиболее сильные и частотные.
Сравнение с другими ассоциативными тезаурусами
| Тезаурус | Год | Язык | Количество стимулов | Количество участников |
|---|---|---|---|---|
| EAT | 1975 | Английский | 8400 | 6500 |
| USF Free Association Norms (Нельсон и др.) | 1998 | Английский | 5019 | 6000 |
| Русский ассоциативный тезаурус (Караулов и др.) | 1994 | Русский | 1277 | 5000 |
| Small World of Words (Стеварт и др.) | 2017 | Многоязычный | 10000+ | 100000+ |
EAT остается одним из старейших и наиболее цитируемых ассоциативных тезаурусов, однако уступает более современным проектам по объему и охвату.
Интересные факты
- Данные EAT использовались при разработке первой версии системы машинного перевода SYSTRAN в 1980-х годах.
- В 2010 году база EAT была интегрирована в проект WordNet, что позволило обогатить семантическую сеть ассоциативными связями.
- Некоторые реакции из EAT стали мемами в научном сообществе: например, на стимул «psychology» (психология) самой частой реакцией было «Freud» (Фрейд).
Источники
- Kiss, G. R., Armstrong, C., Milroy, R., & Piper, J. (1973). An associative thesaurus of English and its computer analysis. In A. J. Aitken, R. W. Bailey, & N. Hamilton-Smith (Eds.), The computer and literary studies. Edinburgh University Press.
- Nelson, D. L., McEvoy, C. L., & Schreiber, T. A. (1998). The University of South Florida word association, rhyme, and word fragment norms. Behavior Research Methods, Instruments, & Computers, 30(3), 413–427.
- Караулов, Ю. Н., Сорокин, Ю. А., Тарасов, Е. Ф., & Уфимцева, Н. В. (1994). Русский ассоциативный словарь. М.: ИЯ РАН.
- Steyvers, M., & Tenenbaum, J. B. (2005). The large-scale structure of semantic networks: Statistical analyses and a model of semantic growth. Cognitive Science, 29(1), 41–78.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →