Частотный словарь русского языка
Частотный словарь русского языка — это лингвистический словарь, в котором лексические единицы (слова, словоформы, словосочетания) расположены в порядке убывания или возрастания частоты их употребления в определённом массиве текстов. Основной целью такого словаря является выявление наиболее употребительной лексики, что позволяет судить о ядре и периферии лексикона, а также о закономерностях речевой деятельности носителей языка.
История создания
Первые работы по составлению частотных списков русской лексики относятся к началу XX века. В 1920-х годах советский лингвист А. А. Леонтьев предпринял попытку создания частотного словаря на основе текстов газет и художественной литературы. Однако систематические исследования начались лишь в середине XX века.
В 1953 году в США под редакцией Г. Г. Йоссельсона был опубликован «The Russian Word Count» — первый крупный частотный словарь русского языка, основанный на анализе 1 миллиона словоупотреблений из текстов 1920–1940-х годов. Этот словарь включал 5230 слов и стал основой для многих последующих исследований.
В СССР значительный вклад в развитие частотной лексикографии внесли Л. Н. Засорина и Э. А. Штейнфельдт. В 1977 году вышел «Частотный словарь русского языка» под редакцией Л. Н. Засориной, основанный на выборке из 1 миллиона словоупотреблений из 400 текстов различных жанров (художественная, публицистическая, научная, официально-деловая литература). Этот словарь содержал 9044 слова и стал эталонным для своего времени.
В 1990-е годы с развитием компьютерных технологий и созданием электронных корпусов текстов (например, Национального корпуса русского языка, НКРЯ) начался новый этап. В 2000-х годах были опубликованы частотные словари на основе данных НКРЯ, в том числе «Частотный словарь современного русского языка» (2009) под редакцией О. Н. Ляшевской и С. А. Шарова, который охватывает более 50 миллионов словоупотреблений.
Методология составления
Источники данных
Частотные словари строятся на основе репрезентативных выборок текстов, которые должны отражать реальное использование языка в определённый период. Основные источники:
- Художественная литература (проза, поэзия, драматургия).
- Публицистика (газеты, журналы, интернет-издания).
- Научные и технические тексты.
- Официально-деловая документация.
- Устная речь (транскрипции разговоров, интервью).
Обработка текста
Процесс включает несколько этапов:
- Токенизация — разбиение текста на отдельные слова (токены).
- Лемматизация — приведение словоформ к начальной форме (именительный падеж для существительных, инфинитив для глаголов и т.д.).
- Подсчёт частот — вычисление абсолютной частоты (количество вхождений) и относительной частоты (доля в общем объёме текста).
- Ранжирование — упорядочивание лемм по убыванию частоты.
Типы частотных словарей
- Алфавитно-частотные — слова расположены в алфавитном порядке, но с указанием частоты.
- Ранговые — слова отсортированы по убыванию частоты, с указанием ранга (места).
- Частотные списки словоформ — учитывают не леммы, а конкретные грамматические формы.
- Дифференциальные — сравнивают частоту в разных жанрах или периодах.
Ключевые характеристики
Ядро лексики
Согласно данным частотных словарей, ядро русского языка (наиболее употребительные слова) составляет около 2000–3000 лемм. Эти слова покрывают 80–90% любого текста. К ним относятся:
- Служебные слова: предлоги (в, на, с), союзы (и, а, но), частицы (не, же, бы).
- Местоимения: я, ты, он, она, это.
- Глаголы: быть, иметь, делать, сказать.
- Существительные: человек, время, дело, жизнь.
Закон Ципфа
Распределение частот в русском языке, как и в большинстве других, подчиняется закону Ципфа: частота слова обратно пропорциональна его рангу. То есть самое частое слово (например, «и») встречается примерно в два раза чаще, чем второе по частоте («в»), и так далее.
Примеры из словаря Засориной (1977)
| Ранг | Слово | Частота (на 1 млн) |
|---|---|---|
| 1 | и | 36500 |
| 2 | в | 21800 |
| 3 | не | 19700 |
| 4 | на | 14800 |
| 5 | я | 13800 |
| 10 | что | 8700 |
| 100 | человек | 1200 |
| 1000 | слово | 150 |
Применение
Лингвистика
- Определение лексического минимума для изучения русского языка как иностранного.
- Анализ стилистических особенностей текстов.
- Исследование исторической динамики лексики.
Лексикография
- Отбор слов для толковых и учебных словарей.
- Создание списков ключевых слов для автоматической обработки текстов.
Образование
- Разработка учебных материалов и тестов по русскому языку.
- Оптимизация методик преподавания: сначала изучаются наиболее частотные слова.
Компьютерная лингвистика
- Обучение моделей машинного обучения (например, для распознавания речи, машинного перевода).
- Создание корпусных менеджеров и поисковых систем.
Критика и ограничения
- Зависимость от корпуса: результаты сильно варьируются в зависимости от выбора текстов. Например, словарь на основе художественной литературы будет отличаться от словаря на основе научных статей.
- Устаревание данных: частотные словари 1970–1980-х годов не отражают современную лексику, включая заимствования (например, «интернет», «смартфон») и неологизмы.
- Игнорирование контекста: частота не учитывает многозначность слов. Например, слово «ключ» может означать и инструмент, и источник воды, и шифр.
- Проблема лемматизации: не всегда возможно однозначно определить начальную форму (например, омонимия «стекло» как существительное и глагол).
Современные разработки
В XXI веке наиболее авторитетным источником частотных данных является Национальный корпус русского языка (НКРЯ), который содержит более 600 миллионов словоупотреблений. На его основе регулярно обновляются частотные списки, доступные в открытом доступе. Также существуют специализированные словари:
- «Частотный словарь современного русского языка» (2009) — 20 000 лемм.
- «Частотный словарь русской устной речи» (2014) — на основе записей разговорной речи.
- «Частотный словарь языка русской поэзии» (2017) — для анализа поэтических текстов.
Интересные факты
- Самое частое слово в русском языке — союз «и», его доля может достигать 3–4% от общего объёма текста.
- В первой сотне частотного списка почти нет существительных, кроме «человек», «время», «дело», «жизнь».
- Частотные словари используются для анализа авторского стиля: например, у Пушкина и Достоевского различаются списки самых частых глаголов.
Источники
- Засорина Л. Н. (ред.) Частотный словарь русского языка. — М.: Русский язык, 1977.
- Ляшевская О. Н., Шаров С. А. Частотный словарь современного русского языка (на материалах Национального корпуса русского языка). — М.: Азбуковник, 2009.
- Йоссельсон Г. Г. The Russian Word Count. — Detroit: Wayne State University Press, 1953.
- Национальный корпус русского языка (ruscorpora.ru).
- Штейнфельдт Э. А. Частотный словарь современного русского литературного языка. — Таллин, 1963.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →