Открыть сервис

Частотный словарь русского языка

Частотный словарь русского языка — это лингвистический словарь, в котором лексические единицы (слова, словоформы, словосочетания) расположены в порядке убывания или возрастания частоты их употребления в определённом массиве текстов. Основной целью такого словаря является выявление наиболее употребительной лексики, что позволяет судить о ядре и периферии лексикона, а также о закономерностях речевой деятельности носителей языка.

История создания

Первые работы по составлению частотных списков русской лексики относятся к началу XX века. В 1920-х годах советский лингвист А. А. Леонтьев предпринял попытку создания частотного словаря на основе текстов газет и художественной литературы. Однако систематические исследования начались лишь в середине XX века.

В 1953 году в США под редакцией Г. Г. Йоссельсона был опубликован «The Russian Word Count» — первый крупный частотный словарь русского языка, основанный на анализе 1 миллиона словоупотреблений из текстов 1920–1940-х годов. Этот словарь включал 5230 слов и стал основой для многих последующих исследований.

В СССР значительный вклад в развитие частотной лексикографии внесли Л. Н. Засорина и Э. А. Штейнфельдт. В 1977 году вышел «Частотный словарь русского языка» под редакцией Л. Н. Засориной, основанный на выборке из 1 миллиона словоупотреблений из 400 текстов различных жанров (художественная, публицистическая, научная, официально-деловая литература). Этот словарь содержал 9044 слова и стал эталонным для своего времени.

В 1990-е годы с развитием компьютерных технологий и созданием электронных корпусов текстов (например, Национального корпуса русского языка, НКРЯ) начался новый этап. В 2000-х годах были опубликованы частотные словари на основе данных НКРЯ, в том числе «Частотный словарь современного русского языка» (2009) под редакцией О. Н. Ляшевской и С. А. Шарова, который охватывает более 50 миллионов словоупотреблений.

Методология составления

Источники данных

Частотные словари строятся на основе репрезентативных выборок текстов, которые должны отражать реальное использование языка в определённый период. Основные источники:

  • Художественная литература (проза, поэзия, драматургия).
  • Публицистика (газеты, журналы, интернет-издания).
  • Научные и технические тексты.
  • Официально-деловая документация.
  • Устная речь (транскрипции разговоров, интервью).

Обработка текста

Процесс включает несколько этапов:

  1. Токенизация — разбиение текста на отдельные слова (токены).
  2. Лемматизация — приведение словоформ к начальной форме (именительный падеж для существительных, инфинитив для глаголов и т.д.).
  3. Подсчёт частот — вычисление абсолютной частоты (количество вхождений) и относительной частоты (доля в общем объёме текста).
  4. Ранжирование — упорядочивание лемм по убыванию частоты.

Типы частотных словарей

  • Алфавитно-частотные — слова расположены в алфавитном порядке, но с указанием частоты.
  • Ранговые — слова отсортированы по убыванию частоты, с указанием ранга (места).
  • Частотные списки словоформ — учитывают не леммы, а конкретные грамматические формы.
  • Дифференциальные — сравнивают частоту в разных жанрах или периодах.

Ключевые характеристики

Ядро лексики

Согласно данным частотных словарей, ядро русского языка (наиболее употребительные слова) составляет около 2000–3000 лемм. Эти слова покрывают 80–90% любого текста. К ним относятся:

  • Служебные слова: предлоги (в, на, с), союзы (и, а, но), частицы (не, же, бы).
  • Местоимения: я, ты, он, она, это.
  • Глаголы: быть, иметь, делать, сказать.
  • Существительные: человек, время, дело, жизнь.

Закон Ципфа

Распределение частот в русском языке, как и в большинстве других, подчиняется закону Ципфа: частота слова обратно пропорциональна его рангу. То есть самое частое слово (например, «и») встречается примерно в два раза чаще, чем второе по частоте («в»), и так далее.

Примеры из словаря Засориной (1977)

РангСловоЧастота (на 1 млн)
1и36500
2в21800
3не19700
4на14800
5я13800
10что8700
100человек1200
1000слово150

Применение

Лингвистика

  • Определение лексического минимума для изучения русского языка как иностранного.
  • Анализ стилистических особенностей текстов.
  • Исследование исторической динамики лексики.

Лексикография

  • Отбор слов для толковых и учебных словарей.
  • Создание списков ключевых слов для автоматической обработки текстов.

Образование

  • Разработка учебных материалов и тестов по русскому языку.
  • Оптимизация методик преподавания: сначала изучаются наиболее частотные слова.

Компьютерная лингвистика

  • Обучение моделей машинного обучения (например, для распознавания речи, машинного перевода).
  • Создание корпусных менеджеров и поисковых систем.

Критика и ограничения

  • Зависимость от корпуса: результаты сильно варьируются в зависимости от выбора текстов. Например, словарь на основе художественной литературы будет отличаться от словаря на основе научных статей.
  • Устаревание данных: частотные словари 1970–1980-х годов не отражают современную лексику, включая заимствования (например, «интернет», «смартфон») и неологизмы.
  • Игнорирование контекста: частота не учитывает многозначность слов. Например, слово «ключ» может означать и инструмент, и источник воды, и шифр.
  • Проблема лемматизации: не всегда возможно однозначно определить начальную форму (например, омонимия «стекло» как существительное и глагол).

Современные разработки

В XXI веке наиболее авторитетным источником частотных данных является Национальный корпус русского языка (НКРЯ), который содержит более 600 миллионов словоупотреблений. На его основе регулярно обновляются частотные списки, доступные в открытом доступе. Также существуют специализированные словари:

  • «Частотный словарь современного русского языка» (2009) — 20 000 лемм.
  • «Частотный словарь русской устной речи» (2014) — на основе записей разговорной речи.
  • «Частотный словарь языка русской поэзии» (2017) — для анализа поэтических текстов.

Интересные факты

  • Самое частое слово в русском языке — союз «и», его доля может достигать 3–4% от общего объёма текста.
  • В первой сотне частотного списка почти нет существительных, кроме «человек», «время», «дело», «жизнь».
  • Частотные словари используются для анализа авторского стиля: например, у Пушкина и Достоевского различаются списки самых частых глаголов.

Источники

  1. Засорина Л. Н. (ред.) Частотный словарь русского языка. — М.: Русский язык, 1977.
  2. Ляшевская О. Н., Шаров С. А. Частотный словарь современного русского языка (на материалах Национального корпуса русского языка). — М.: Азбуковник, 2009.
  3. Йоссельсон Г. Г. The Russian Word Count. — Detroit: Wayne State University Press, 1953.
  4. Национальный корпус русского языка (ruscorpora.ru).
  5. Штейнфельдт Э. А. Частотный словарь современного русского литературного языка. — Таллин, 1963.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →