Тезаурус
Тезаурус — это словарь, в котором лексические единицы (слова, словосочетания, термины) сгруппированы не по алфавиту, а по смысловому сходству, тематическим категориям или иерархическим связям. В отличие от толкового или переводного словаря, тезаурус фиксирует не столько значения слов, сколько отношения между ними: синонимию, антонимию, родо-видовые связи (гиперонимы и гипонимы), ассоциации и принадлежность к одной предметной области. Термин происходит от греческого слова «θησαυρός» (сокровище, сокровищница) и в современной лингвистике и информатике обозначает как тип словаря, так и модель семантической сети, используемую для обработки естественного языка.
История развития
Античность и Средневековье
Первые прообразы тезаурусов появились ещё в античности. В Древней Греции и Риме составлялись списки синонимов для риторических целей — например, сочинения греческого грамматиста Аполлония Дискола или римского ритора Квинтилиана. В Средние века в Византии и арабском мире создавались энциклопедические своды, в которых слова группировались по темам (например, «Суда» — византийский энциклопедический словарь X века). В русской традиции одним из ранних аналогов можно считать «Азбуковники» — рукописные сборники, содержащие объяснения непонятных слов, сгруппированные по тематическим разделам.
XVI–XIX века
Современный тип тезауруса начал формироваться в эпоху Возрождения. В 1552 году французский филолог Робер Этьенн издал «Thesaurus linguae Latinae» — латинский словарь, построенный по алфавитному принципу, но включавший обширные синонимические ряды. В 1573 году вышло издание «Thesaurus graecae linguae» Анри Этьенна, посвящённое древнегреческому языку. Эти работы заложили основу для филологических тезаурусов.
В 1852 году британский лексикограф Питер Марк Роже опубликовал «Тезаурус английских слов и фраз» (Roget’s Thesaurus), который стал классическим образцом идеографического словаря. Роже разделил всю лексику английского языка на шесть основных категорий (абстрактные отношения, пространство, материя, интеллект, воля, чувства), каждая из которых дробилась на более мелкие группы. Этот тезаурус многократно переиздавался и до сих пор используется в англоязычном мире.
XX–XXI века
В XX веке тезаурусы стали активно применяться в информатике и библиотечном деле. В 1960-х годах были разработаны первые информационно-поисковые тезаурусы — контролируемые словари для индексирования документов. Примером служит «Тезаурус по информатике» (1965) и «Тезаурус ЮНЕСКО». В 1980-х годах появились электронные тезаурусы, такие как WordNet (Принстонский университет, США), который представляет собой крупную лексическую базу данных английского языка с семантическими связями. В России аналогичные проекты включают «Русский семантический словарь» под редакцией Н. Ю. Шведовой и «Тезаурус русского языка» (RuWordNet).
Классификация тезаурусов
По цели создания
- Лингвистические — предназначены для изучения лексики, синонимии, семантических полей. Примеры: Roget’s Thesaurus, «Словарь синонимов русского языка» под редакцией А. П. Евгеньевой.
- Информационно-поисковые — используются для индексирования документов и поиска информации в базах данных. Содержат термины и связи между ними (например, «вышестоящий термин», «нижестоящий термин», «связанный термин»). Пример: «Тезаурус по библиотековедению и информатике».
- Учебные — создаются для изучения иностранных языков или специальных дисциплин. В них слова группируются по темам (например, «Еда», «Одежда», «Путешествия»).
По структуре
- Идеографические — слова организованы по понятийным категориям (от общего к частному). Пример: тезаурус Роже.
- Синонимические — основное внимание уделяется рядам синонимов и антонимов. Пример: «Словарь синонимов» З. Е. Александровой.
- Иерархические — термины выстроены в родо-видовые цепочки (например, «животное» → «млекопитающее» → «собака»). Часто используются в информационно-поисковых системах.
- Ассоциативные — фиксируют любые смысловые связи между словами, включая причинно-следственные, функциональные и т. д. Пример: WordNet.
По охвату
- Общие — охватывают лексику литературного языка без ограничения по тематике.
- Специальные (отраслевые) — посвящены одной области знаний: медицине, юриспруденции, информатике, биологии и т. д. Пример: «Тезаурус по психологии», «Тезаурус по химии».
Устройство и структура
Основные элементы
- Дескрипторы — основные термины, используемые для индексирования. В информационно-поисковых тезаурусах они являются предпочтительными лексическими единицами.
- Недискрипторы — синонимы или варианты терминов, отсылающие к дескрипторам (например, «автомобиль → машина»).
- Семантические отношения:
- Синонимия — слова, близкие по значению (например, «дом — здание — строение»).
- Гиперо-гипонимия — родо-видовые связи (например, «мебель — стол»).
- Антонимия — противоположные значения (например, «холодный — горячий»).
- Меронимия — отношение «часть — целое» (например, «колесо — автомобиль»).
- Ассоциативные связи — любые другие смысловые отношения (например, «врач — больница — лечение»).
Форма представления
В печатных тезаурусах слова обычно группируются в тематические блоки, а в конце приводится алфавитный указатель. В электронных версиях используется гипертекстовая структура: каждое слово может быть связано с другими словами через ссылки. В базах данных (например, WordNet) лексические единицы объединены в синсеты (синонимические множества), каждый из которых имеет уникальный идентификатор.
Применение
Лингвистика и лексикография
Тезаурусы используются для изучения семантической структуры языка, выявления синонимических рядов, анализа лексических полей. Они служат основой для составления толковых и переводных словарей, а также для исследования исторических изменений в лексике.
Информационный поиск
В библиотеках и базах данных тезаурусы помогают улучшить точность поиска. Пользователь может ввести запрос, а система автоматически расширит его за счёт синонимов и родственных терминов. Например, при поиске «автомобиль» система может найти документы, содержащие слова «машина», «легковой автомобиль», «транспортное средство». Это особенно важно в научных и технических базах данных.
Обработка естественного языка (NLP)
В компьютерной лингвистике тезаурусы применяются для:
- Семантического анализа — определения смысла слов в контексте.
- Машинного перевода — подбора эквивалентов в целевом языке.
- Извлечения информации — распознавания сущностей и связей между ними.
- Создания чат-ботов и голосовых ассистентов — для понимания запросов пользователя.
Образование
Учебные тезаурусы используются при изучении иностранных языков: они помогают запоминать слова не изолированно, а в контексте тематических групп. В русском языке популярны тематические словари, например, «Русский язык. Тематический словарь» для школьников.
Примеры известных тезаурусов
Roget’s Thesaurus
Классический тезаурус английского языка, впервые опубликованный в 1852 году. Содержит около 1000 категорий, разделённых на шесть классов. До сих пор переиздаётся и используется как справочное пособие.
WordNet
Лексическая база данных английского языка, разработанная в Принстонском университете (США) под руководством Джорджа Миллера. Включает более 150 000 слов, объединённых в синсеты. Связи между синсетами включают гиперонимию, гипонимию, меронимию и антонимию. WordNet стал основой для многих проектов в области NLP, включая русскоязычный аналог RuWordNet.
RuWordNet
Русскоязычная версия WordNet, разрабатываемая в Институте проблем передачи информации имени А. А. Харкевича РАН. Содержит около 100 000 слов и 60 000 синсетов. Используется для задач семантического анализа русского языка.
Тезаурус ЮНЕСКО
Многоязычный информационно-поисковый тезаурус, разработанный ЮНЕСКО. Содержит термины по образованию, науке, культуре и социальным наукам. Используется для индексирования документов в библиотеках и архивах.
«Словарь синонимов русского языка» под редакцией А. П. Евгеньевой
Один из наиболее авторитетных синонимических словарей русского языка, изданный в 1970–1971 годах. Содержит около 4000 синонимических рядов. Хотя формально это не тезаурус в строгом смысле, он часто используется как его аналог.
Критика и ограничения
Тезаурусы имеют ряд недостатков. Во-первых, они фиксируют только статичные семантические связи, не учитывая контекст употребления слов. Например, слово «ключ» может означать и инструмент для замка, и источник воды, и музыкальный знак — в тезаурусе эти значения часто объединяются в один синонимический ряд, что может вводить в заблуждение. Во-вторых, создание качественного тезауруса требует больших затрат времени и ресурсов, особенно для языков с богатой лексикой. В-третьих, тезаурусы, особенно старые, могут не отражать современные изменения в языке (неологизмы, сленг, заимствования). Наконец, в информационно-поисковых системах тезаурусы иногда уступают по эффективности более современным методам, основанным на машинном обучении и векторных представлениях слов (word embeddings).
Источники
- Роже П. М. Тезаурус английских слов и фраз. — 1852.
- Миллер Дж. WordNet: лексическая база данных английского языка. — Принстонский университет, 1985.
- Шведова Н. Ю. Русский семантический словарь. — М.: Азбуковник, 1998.
- Евгеньева А. П. Словарь синонимов русского языка. — Л.: Наука, 1970–1971.
- RuWordNet: семантическая сеть русского языка. — Институт проблем передачи информации РАН.
- Тезаурус ЮНЕСКО: руководство по использованию. — ЮНЕСКО, 1995.
- Крысин Л. П. Лексикография русского языка. — М.: Флинта, 2016.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →