Вероятностный латентно-семантический анализ
Вероятностный латентно-семантический анализ (PLSA, Probabilistic Latent Semantic Analysis) — это статистический метод тематического моделирования, предназначенный для выявления скрытых (латентных) тем в коллекциях текстовых документов. Он основан на вероятностной модели, которая описывает процесс порождения слов в документах через распределение по темам. PLSA является развитием латентно-семантического анализа (LSA) и предшественником более сложных методов, таких как латентное размещение Дирихле (LDA).
История
Метод вероятностного латентно-семантического анализа был предложен в 1999 году Томасом Хофманном (Thomas Hofmann) в рамках работы над статистическими моделями для обработки естественного языка. Хофманн стремился преодолеть ограничения классического латентно-семантического анализа (LSA), который использовал сингулярное разложение матрицы (SVD) и не имел строгой вероятностной интерпретации. PLSA ввёл вероятностную основу, что позволило более гибко моделировать распределения слов и документов.
В начале 2000-х годов PLSA активно применялся в задачах информационного поиска, классификации текстов и анализа тональности. Однако в 2003 году Дэвид Блей, Эндрю Ын и Майкл Джордан предложили латентное размещение Дирихле (LDA), которое обобщило PLSA, добавив априорные распределения для тем. Несмотря на это, PLSA остаётся востребованным в прикладных задачах благодаря своей интерпретируемости и относительной простоте реализации.
Математическая модель
Основные понятия
PLSA моделирует коллекцию из \( D \) документов, каждый из которых содержит последовательность слов из словаря размером \( W \). Предполагается, что существует \( K \) скрытых тем, которые не наблюдаются напрямую, но определяют распределение слов в документах.
Модель основана на следующих вероятностных распределениях:
- \( P(d) \) — вероятность выбора документа \( d \) из коллекции.
- \( P(z|d) \) — вероятность темы \( z \) в документе \( d \).
- \( P(w|z) \) — вероятность слова \( w \) при заданной теме \( z \).
Процесс порождения документа описывается следующим образом:
- Выбирается документ \( d \) с вероятностью \( P(d) \).
- Для каждого слова в документе выбирается тема \( z \) с вероятностью \( P(z|d) \).
- Слово \( w \) генерируется с вероятностью \( P(w|z) \).
Таким образом, совместная вероятность документа и слова вычисляется как:
\[ P(d, w) = P(d) \sum_{z=1}^{K} P(z|d) P(w|z) \]
Оценка параметров
Параметры модели — \( P(z|d) \) и \( P(w|z) \) — оцениваются методом максимизации правдоподобия на основе наблюдаемых данных (матрицы «документ-термин»). Для этого используется алгоритм Expectation-Maximization (EM).
Алгоритм EM состоит из двух шагов:
- E-шаг: вычисление апостериорных вероятностей тем для каждого слова в каждом документе:
\[ P(z|d, w) = \frac{P(z|d) P(w|z)}{\sum_{z'} P(z'|d) P(w|z')} \]
- M-шаг: обновление параметров на основе ожидаемых значений:
\[ P(w|z) = \frac{\sum_d n(d, w) P(z|d, w)}{\sum_{w'} \sum_d n(d, w') P(z|d, w')} \] \[ P(z|d) = \frac{\sum_w n(d, w) P(z|d, w)}{\sum_{z'} \sum_w n(d, w) P(z'|d, w)} \]
Здесь \( n(d, w) \) — частота слова \( w \) в документе \( d \). Алгоритм итеративно повторяется до сходимости.
Отличия от LSA
Вероятностный латентно-семантический анализ отличается от классического латентно-семантического анализа (LSA) по нескольким ключевым параметрам:
| Характеристика | LSA | PLSA |
|---|---|---|
| Основа | Линейная алгебра (SVD) | Вероятностная модель |
| Интерпретация | Сингулярные векторы не имеют вероятностного смысла | Параметры — вероятности |
| Оценка | Сингулярное разложение | EM-алгоритм |
| Гибкость | Фиксированное число тем | Число тем задаётся, но модель адаптивна |
| Недостатки | Чувствительность к разреженности, сложность интерпретации | Переобучение при малом числе документов |
PLSA обеспечивает более строгую статистическую основу, но требует больше вычислительных ресурсов из-за итеративного EM-алгоритма.
Применение
Тематическое моделирование
PLSA используется для автоматического выделения тем в больших текстовых коллекциях. Например, в научных статьях, новостных лентах или архивах документов. Каждая тема представляется набором слов с наибольшими вероятностями \( P(w|z) \).
Информационный поиск
Метод применяется для улучшения ранжирования результатов поиска. PLSA позволяет учитывать семантическую близость документов, даже если они не содержат одинаковых ключевых слов. Например, запрос «автомобиль» может быть связан с документами, содержащими слова «машина», «двигатель», «транспорт».
Классификация и кластеризация текстов
PLSA часто используется как этап предобработки для снижения размерности признакового пространства. Полученные тематические распределения \( P(z|d) \) могут служить признаками для классификаторов (например, SVM или нейронных сетей).
Анализ тональности
В задачах анализа тональности PLSA помогает выделять темы, связанные с положительными или отрицательными отзывами. Например, в отзывах на фильмы тема «сюжет» может быть связана с положительными словами, а тема «актёрская игра» — с отрицательными.
Пример
Рассмотрим простой пример с коллекцией из трёх документов:
- Документ 1: «кот собака дом»
- Документ 2: «кот дом сад»
- Документ 3: «собака сад парк»
При \( K = 2 \) темах PLSA может выделить:
- Тема 1: слова «кот», «дом» (вероятности 0.5 и 0.4).
- Тема 2: слова «собака», «сад», «парк» (вероятности 0.4, 0.3, 0.3).
Распределения \( P(z|d) \) покажут, что документ 1 относится к теме 1 с вероятностью 0.8, а документ 3 — к теме 2 с вероятностью 0.9.
Ограничения
- Отсутствие априорных распределений: PLSA не включает априорные распределения для тем, что может приводить к переобучению на малых выборках. Это ограничение преодолено в LDA.
- Чувствительность к начальным условиям: EM-алгоритм может сходиться к локальным оптимумам, поэтому результаты зависят от начальной инициализации.
- Вычислительная сложность: Для больших коллекций (миллионы документов) PLSA требует значительных вычислительных ресурсов, особенно при большом числе тем.
- Неспособность обрабатывать новые документы: PLSA не может напрямую оценить темы для документа, не входившего в обучающую выборку, без повторного обучения.
Интересные факты
- PLSA иногда называют «аспектной моделью» (aspect model) в контексте анализа текстов.
- Метод нашёл применение не только в лингвистике, но и в биоинформатике для анализа экспрессии генов.
- В 2010-х годах PLSA был вытеснен LDA и нейросетевыми методами, но остаётся популярным в учебных курсах по машинному обучению.
Источники
- Hofmann, T. (1999). Probabilistic Latent Semantic Analysis. Proceedings of the 15th Conference on Uncertainty in Artificial Intelligence.
- Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research.
- Deerwester, S., Dumais, S. T., Furnas, G. W., Landauer, T. K., & Harshman, R. (1990). Indexing by Latent Semantic Analysis. Journal of the American Society for Information Science.
- Manning, C. D., & Schütze, H. (1999). Foundations of Statistical Natural Language Processing. MIT Press.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →