Закон Зипфа
Закон Зипфа — это эмпирическая закономерность, наблюдаемая в лингвистике, информатике и других науках, согласно которой частота встречаемости элемента в упорядоченном множестве (например, слова в тексте) обратно пропорциональна его рангу. В наиболее распространённой формулировке, если все слова текста расположить в порядке убывания частоты их употребления, то частота второго по популярности слова будет примерно вдвое меньше, чем первого, третьего — втрое меньше, и так далее. Закон назван в честь американского лингвиста Джорджа Кингсли Зипфа, который популяризировал эту закономерность в 1930-х годах, хотя подобные наблюдения делались и ранее.
История открытия
Первые наблюдения, близкие к закону Зипфа, были сделаны ещё в XIX веке. Французский филолог Жан-Батист Эсту (Jean-Baptiste Estoup) в 1916 году заметил, что в текстах французского языка частоты слов распределены неравномерно, и предложил математическую модель. В 1928 году немецкий физик Фридрих Ауэрбах (Friedrich Auerbach) независимо пришёл к аналогичному выводу, изучая частотность слов в немецком языке. Однако именно Джордж Кингсли Зипф в 1935 году в книге «Психо-биология языка» (The Psycho-Biology of Language) и в 1949 году в работе «Человеческое поведение и принцип наименьшего усилия» (Human Behavior and the Principle of Least Effort) систематизировал данные и сформулировал закон как универсальный принцип, связанный с экономией речевых усилий.
Зипф предположил, что говорящие стремятся минимизировать свои усилия, используя небольшое количество часто повторяющихся слов, в то время как слушающие, напротив, заинтересованы в большом разнообразии лексики для точного понимания. Компромисс между этими двумя тенденциями и порождает наблюдаемое распределение.
Математическая формулировка
В классическом виде закон Зипфа записывается как:
\[ f(r) \propto \frac{1}{r^a} \]
где:
- \( f(r) \) — частота слова с рангом \( r \);
- \( r \) — ранг слова (1 — самое частое слово, 2 — второе по частоте и т. д.);
- \( a \) — показатель степени, обычно близкий к 1 (для естественных языков \( a \approx 1 \));
- \( \propto \) — символ пропорциональности.
В логарифмических координатах (log-log plot) это соотношение выглядит как прямая линия с наклоном, равным \(-a\). Для большинства естественных языков наклон составляет примерно \(-1\), что соответствует \( a = 1 \). Однако точное значение может незначительно варьироваться в зависимости от языка, жанра текста и объёма выборки.
Существуют также уточнённые версии закона, например, закон Зипфа — Мандельброта, предложенный математиком Бенуа Мандельбротом. Он добавил дополнительный параметр для учёта отклонений на малых рангах:
\[ f(r) = \frac{C}{(r + b)^a} \]
где \( b \) — константа, корректирующая поведение для самых частых слов, а \( C \) — нормирующий множитель.
Примеры и эмпирические данные
В естественных языках
В любом достаточно длинном тексте на русском, английском или другом языке первые несколько слов (артикли, предлоги, союзы, местоимения) составляют значительную долю всех словоупотреблений. Например, в английском языке слово «the» может занимать около 6–7 % всех слов текста, «of» — около 3–4 %, «and» — около 2–3 %. Следующие слова имеют резко убывающую частоту. Для русского языка типичная картина: слово «в» (предлог) может составлять около 4–5 %, «и» — около 3–4 %, «не» — около 2–3 %. Слова с рангом выше 100–200 встречаются уже крайне редко.
В компьютерных науках
Закон Зипфа проявляется в распределении запросов в поисковых системах, частоты обращений к веб-страницам, размера файлов в архивах, а также в распределении популярности контента в социальных сетях. Например, небольшое количество сайтов получает основную массу трафика, а подавляющее большинство сайтов имеют очень низкую посещаемость.
В других областях
- Библиометрия: распределение цитирований статей — небольшое число публикаций цитируется очень часто, большинство — редко.
- География: распределение размеров городов по численности населения — крупнейшие города (например, Москва, Санкт-Петербург) значительно превосходят по населению остальные.
- Музыка: распределение нот в композициях — некоторые ноты и интервалы встречаются гораздо чаще других.
- Экономика: распределение доходов — небольшое количество людей получает большую часть доходов (принцип Парето, который близок по духу, но не тождественен закону Зипфа).
Механизмы и объяснения
Единого общепринятого объяснения закона Зипфа не существует, но выделяют несколько гипотез:
- Принцип наименьшего усилия (Зипф): говорящие предпочитают короткие и часто употребляемые слова, чтобы сократить затраты энергии, а слушающие — разнообразие для точности. Компромисс порождает степенное распределение.
- Случайные процессы: некоторые модели, такие как «богатый становится богаче» (preferential attachment) или процесс Юла — Саймона, показывают, что степенное распределение возникает естественным образом при случайном выборе элементов с вероятностью, пропорциональной текущей частоте.
- Структура языка: ограниченность человеческой памяти и необходимость кодирования информации приводят к тому, что наиболее часто используемые понятия кодируются короткими и простыми словами, что также даёт степенное распределение.
Критика и ограничения
Закон Зипфа является эмпирическим, а не точным математическим законом. На практике наблюдаются отклонения:
- Для самых частых слов (ранг 1–10) частота может быть несколько ниже предсказанной, особенно в языках с богатой морфологией (например, русский, немецкий).
- Для редких слов (большие ранги) распределение может становиться более шумным из-за малого объёма выборки.
- В разных текстах и жанрах показатель \( a \) может варьироваться от 0,8 до 1,2.
- Закон плохо работает для очень коротких текстов (менее нескольких тысяч слов).
Критики также отмечают, что закон Зипфа не является универсальным для всех языков: например, в некоторых изолирующих языках (китайский, вьетнамский) распределение может отличаться из-за иной структуры слова.
Применение
- Компьютерная лингвистика: используется для сжатия текстов (например, в кодировании Хаффмана), для построения частотных словарей, для анализа стиля авторов (авторометрия).
- Информационный поиск: для ранжирования документов, для оценки значимости терминов (TF-IDF использует обратную частоту, что связано с законом Зипфа).
- Социология и экономика: для моделирования распределения доходов, размеров компаний, популярности товаров.
- Биология: для анализа частот аминокислот в белках, распределения видов по численности.
Интересные факты
- Закон Зипфа наблюдается даже в таких неожиданных областях, как распределение имён в телефонных справочниках или частотность цифр в числах π и e.
- В 2005 году исследователи показали, что закон Зипфа выполняется для распределения длин слов в текстах: короткие слова встречаются чаще, длинные — реже.
- Существует гипотеза, что закон Зипфа является следствием фрактальной структуры языка, то есть самоподобия на разных масштабах.
Источники
- Zipf, G. K. (1935). The Psycho-Biology of Language. Houghton Mifflin.
- Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Addison-Wesley.
- Mandelbrot, B. (1953). «An informational theory of the statistical structure of language». Communication Theory, 486–502.
- Newman, M. E. J. (2005). «Power laws, Pareto distributions and Zipf's law». Contemporary Physics, 46(5), 323–351.
- Плунгян, В. А. (2016). Общая морфология: Введение в проблематику. М.: УРСС.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →