Открыть сервис

Вероятностный латентно-семантический анализ

Вероятностный латентно-семантический анализ (PLSA, Probabilistic Latent Semantic Analysis) — это статистический метод тематического моделирования, предназначенный для выявления скрытых (латентных) тем в коллекциях текстовых документов. Он основан на вероятностной модели, которая описывает процесс порождения слов в документах через распределение по темам. PLSA является развитием латентно-семантического анализа (LSA) и предшественником более сложных методов, таких как латентное размещение Дирихле (LDA).

История

Метод вероятностного латентно-семантического анализа был предложен в 1999 году Томасом Хофманном (Thomas Hofmann) в рамках работы над статистическими моделями для обработки естественного языка. Хофманн стремился преодолеть ограничения классического латентно-семантического анализа (LSA), который использовал сингулярное разложение матрицы (SVD) и не имел строгой вероятностной интерпретации. PLSA ввёл вероятностную основу, что позволило более гибко моделировать распределения слов и документов.

В начале 2000-х годов PLSA активно применялся в задачах информационного поиска, классификации текстов и анализа тональности. Однако в 2003 году Дэвид Блей, Эндрю Ын и Майкл Джордан предложили латентное размещение Дирихле (LDA), которое обобщило PLSA, добавив априорные распределения для тем. Несмотря на это, PLSA остаётся востребованным в прикладных задачах благодаря своей интерпретируемости и относительной простоте реализации.

Математическая модель

Основные понятия

PLSA моделирует коллекцию из \( D \) документов, каждый из которых содержит последовательность слов из словаря размером \( W \). Предполагается, что существует \( K \) скрытых тем, которые не наблюдаются напрямую, но определяют распределение слов в документах.

Модель основана на следующих вероятностных распределениях:

  • \( P(d) \) — вероятность выбора документа \( d \) из коллекции.
  • \( P(z|d) \) — вероятность темы \( z \) в документе \( d \).
  • \( P(w|z) \) — вероятность слова \( w \) при заданной теме \( z \).

Процесс порождения документа описывается следующим образом:

  1. Выбирается документ \( d \) с вероятностью \( P(d) \).
  2. Для каждого слова в документе выбирается тема \( z \) с вероятностью \( P(z|d) \).
  3. Слово \( w \) генерируется с вероятностью \( P(w|z) \).

Таким образом, совместная вероятность документа и слова вычисляется как:

\[ P(d, w) = P(d) \sum_{z=1}^{K} P(z|d) P(w|z) \]

Оценка параметров

Параметры модели — \( P(z|d) \) и \( P(w|z) \) — оцениваются методом максимизации правдоподобия на основе наблюдаемых данных (матрицы «документ-термин»). Для этого используется алгоритм Expectation-Maximization (EM).

Алгоритм EM состоит из двух шагов:

  • E-шаг: вычисление апостериорных вероятностей тем для каждого слова в каждом документе:

\[ P(z|d, w) = \frac{P(z|d) P(w|z)}{\sum_{z'} P(z'|d) P(w|z')} \]

  • M-шаг: обновление параметров на основе ожидаемых значений:

\[ P(w|z) = \frac{\sum_d n(d, w) P(z|d, w)}{\sum_{w'} \sum_d n(d, w') P(z|d, w')} \] \[ P(z|d) = \frac{\sum_w n(d, w) P(z|d, w)}{\sum_{z'} \sum_w n(d, w) P(z'|d, w)} \]

Здесь \( n(d, w) \) — частота слова \( w \) в документе \( d \). Алгоритм итеративно повторяется до сходимости.

Отличия от LSA

Вероятностный латентно-семантический анализ отличается от классического латентно-семантического анализа (LSA) по нескольким ключевым параметрам:

ХарактеристикаLSAPLSA
ОсноваЛинейная алгебра (SVD)Вероятностная модель
ИнтерпретацияСингулярные векторы не имеют вероятностного смыслаПараметры — вероятности
ОценкаСингулярное разложениеEM-алгоритм
ГибкостьФиксированное число темЧисло тем задаётся, но модель адаптивна
НедостаткиЧувствительность к разреженности, сложность интерпретацииПереобучение при малом числе документов

PLSA обеспечивает более строгую статистическую основу, но требует больше вычислительных ресурсов из-за итеративного EM-алгоритма.

Применение

Тематическое моделирование

PLSA используется для автоматического выделения тем в больших текстовых коллекциях. Например, в научных статьях, новостных лентах или архивах документов. Каждая тема представляется набором слов с наибольшими вероятностями \( P(w|z) \).

Информационный поиск

Метод применяется для улучшения ранжирования результатов поиска. PLSA позволяет учитывать семантическую близость документов, даже если они не содержат одинаковых ключевых слов. Например, запрос «автомобиль» может быть связан с документами, содержащими слова «машина», «двигатель», «транспорт».

Классификация и кластеризация текстов

PLSA часто используется как этап предобработки для снижения размерности признакового пространства. Полученные тематические распределения \( P(z|d) \) могут служить признаками для классификаторов (например, SVM или нейронных сетей).

Анализ тональности

В задачах анализа тональности PLSA помогает выделять темы, связанные с положительными или отрицательными отзывами. Например, в отзывах на фильмы тема «сюжет» может быть связана с положительными словами, а тема «актёрская игра» — с отрицательными.

Пример

Рассмотрим простой пример с коллекцией из трёх документов:

  • Документ 1: «кот собака дом»
  • Документ 2: «кот дом сад»
  • Документ 3: «собака сад парк»

При \( K = 2 \) темах PLSA может выделить:

  • Тема 1: слова «кот», «дом» (вероятности 0.5 и 0.4).
  • Тема 2: слова «собака», «сад», «парк» (вероятности 0.4, 0.3, 0.3).

Распределения \( P(z|d) \) покажут, что документ 1 относится к теме 1 с вероятностью 0.8, а документ 3 — к теме 2 с вероятностью 0.9.

Ограничения

  • Отсутствие априорных распределений: PLSA не включает априорные распределения для тем, что может приводить к переобучению на малых выборках. Это ограничение преодолено в LDA.
  • Чувствительность к начальным условиям: EM-алгоритм может сходиться к локальным оптимумам, поэтому результаты зависят от начальной инициализации.
  • Вычислительная сложность: Для больших коллекций (миллионы документов) PLSA требует значительных вычислительных ресурсов, особенно при большом числе тем.
  • Неспособность обрабатывать новые документы: PLSA не может напрямую оценить темы для документа, не входившего в обучающую выборку, без повторного обучения.

Интересные факты

  • PLSA иногда называют «аспектной моделью» (aspect model) в контексте анализа текстов.
  • Метод нашёл применение не только в лингвистике, но и в биоинформатике для анализа экспрессии генов.
  • В 2010-х годах PLSA был вытеснен LDA и нейросетевыми методами, но остаётся популярным в учебных курсах по машинному обучению.

Источники

  • Hofmann, T. (1999). Probabilistic Latent Semantic Analysis. Proceedings of the 15th Conference on Uncertainty in Artificial Intelligence.
  • Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research.
  • Deerwester, S., Dumais, S. T., Furnas, G. W., Landauer, T. K., & Harshman, R. (1990). Indexing by Latent Semantic Analysis. Journal of the American Society for Information Science.
  • Manning, C. D., & Schütze, H. (1999). Foundations of Statistical Natural Language Processing. MIT Press.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →