Поиск слова в русском языке¶
Поиск слова — это лингвистическая и информационно-поисковая задача, связанная с нахождением слова или его форм в тексте, словаре, корпусе или базе данных. Задача решается в нескольких плоскостях: от ручного лексикографического поиска по словарям до автоматизированных алгоритмов полнотекстового поиска в информационных системах. В русскоязычной традиции поиск слова имеет давнюю историю, связанную с созданием толковых словарей, академических изданий и современных корпусов русского языка.
¶История
¶Словарный поиск
До появления электронных систем поиск слова выполнялся вручную по печатным изданиям. Ключевыми русскими словарями, в которых поиск слова был организован по алфавиту и снабжён указателями, относятся:
- «Словарь Академии Российской» (1789—1794) — первый нормативный толковый словарь русского языка;
- «Толковый словарь живого великорусского языка» Владимира Даля (1863—1866) — словарь, построенный на материале этнографических описаний и диалектных наблюдений;
- «Словарь русского языка» С. И. Ожегова (1949) и «Толковый словарь русского языка» Д. Н. Ушакова (1935—1940) — нормативные издания советского периода;
- «Словарь русского языка» в четырёх томах под редакцией С. А. Ожегова и Н. Ю. Шведовой (1981—1984).
Поиск слова в этих изданиях предполагал знание орфографии и умение работать с алфавитным порядком, а также с сокращениями и пометами, принятыми в словарной статье.
¶Академические проекты
В XX веке в СССР были реализованы масштабные академические проекты, связанные с поиском и описанием слов русского языка. Среди них — «Словарь русского языка» в 17 томах (1950—1965) и «Словарь современного русского литературного языка» в 11 томах (1950—1965), изданный Академией наук СССР. Эти издания содержали тысячи статей и служили основой для дальнейших лексикографических исследований.
¶Автоматический поиск слова
¶Полнотекстовый поиск
С развитием вычислительной техники поиск слова стал выполняться автоматически. Полнотекстовый поиск — это метод поиска информации, при котором система анализирует весь текст документов, а не только их метаданные (заголовки, авторы, ключевые слова). Алгоритмы полнотекстового поиска используют инвертированные индексы — структуры данных, сопоставляющие каждое слово со списком документов, в которых оно встречается.
Для русского языка автоматический поиск слова осложнён богатой морфологией: одно слово может иметь десятки форм (падежные, временные, видовые). Поэтому русскоязычные поисковые системы применяют:
- лемматизацию — приведение словоформ к словарной форме (лемме);
- стемминг — выделение основы слова (например, алгоритм Сноубола, адаптированный для русского языка);
- морфологический анализ — определение всех возможных разборов словоформы.
¶Поиск в корпусах
Корпус русского языка — это электронная база текстов, снабжённая лингвистической разметкой. Крупнейшие русскоязычные корпуса — Национальный корпус русского языка (НКРЯ), созданный в 2004—2005 годах под руководством А. А. Зализняка, и параллельный русско-английский корпус. В корпусах поиск слова выполняется с учётом грамматических характеристик: можно искать слово в конкретной форме, с определённой частью речи, в сочетании с другими словами.
¶Методы и алгоритмы
Поиск слова в информационных системах строится на нескольких принципах:
| Метод | Описание | Применение |
|---|---|---|
| Точное совпадение | Поиск словоформы как есть | Простые системы, поиск по цитатам |
| Лемматизация | Приведение к словарной форме | Поисковые системы, корпуса |
| Стемминг | Выделение основы слова | Поиск с опечатками, морфологически богатые языки |
| Нечёткое совпадение | Поиск с учётом расстояния Левенштейна | Исправление опечаток, поиск синонимов |
Расстояние Левенштейна — метрика, измеряющая минимальное количество операций вставки, удаления и замены символов, необходимых для превращения одной строки в другую. Она применяется в поисковых системах для обработки опечаток и вариантов написания слова.
¶Применение
Поиск слова используется в различных областях:
- Лексикография — составление словарей, индексов, указателей;
- Перевод — поиск эквивалентов слова в параллельных корпусах;
- Обучение языку — поиск примеров употребления слова в контексте;
- Юриспруденция — поиск нормативных актов по ключевым словам;
- Программирование — поиск по документации, исходному коду;
- Исследования в области естественного языка — анализ частотности, сочетаемости, исторической динамики слова.
¶См. также
- Лемматизация
- Стемминг
- Полнотекстовый поиск
- Национальный корпус русского языка
- Инвертированный индекс
- Расстояние Левенштейна
¶Источники
- Ожегов С. И. Словарь русского языка. — М.: Русский язык, 1988.
- Ушаков Д. Н. Толковый словарь русского языка. — М.: АСТ, 2003.
- Даль В. И. Толковый словарь живого великорусского языка. — М.: Русский язык, 1989.
- Зализняк А. А. Русское именное словоизменение. — М.: Языки славянской культуры, 2007.
- Шаров А. Г. Лексикография: учебное пособие. — М.: Флинта, 2009.
- Морозов В. А. Информационный поиск: учебное пособие. — М.: Флинта, 2012.
