Открыть сервис

LS-модели в языкознании

LS-модель (от англ. LS model, также «модель Лейкока—Шарплесса») — в лингвистике и компьютерной обработке текста обозначает формальную схему описания синтаксической структуры предложения, основанную на линейно-сегментном представлении. В более широком значении термин используется для обозначения статистических латентно-семантических моделей (Latent Semantic), применяемых в информационном поиске и анализе текстов. В зависимости от контекста аббревиатура LS может расшифровываться по-разному, что приводит к многозначности термина в научной и технической литературе.

История возникновения

Понятие LS-модели впервые получило распространение в конце XX века в двух независимых научных направлениях. В теоретической лингвистике советской и российской школы термин «линейно-сегментная модель» использовался для описания порядка слов и интонационного членения высказывания. Исследователи, работавшие в рамках коммуникативной грамматики, предлагали рассматривать предложение не как иерархическое дерево зависимостей, а как последовательность сегментов, каждый из которых несёт определённую коммуникативную нагрузку.

Параллельно в англоязычной компьютерной лингвистике развивалась латентно-семантическая модель (Latent Semantic Analysis, LSA), которую в сокращённом виде также называли LS-моделью. Она была предложена в 1988 году группой исследователей во главе с Томасом Ландауэром и Сьюзен Дютро в Bellcore. Эта модель предназначалась для анализа больших массивов текстов и выявления скрытых (латентных) смысловых связей между словами и документами.

Линейно-сегментная модель в синтаксисе

В рамках линейно-сегментного подхода предложение рассматривается как цепочка сегментов — минимальных интонационно-смысловых единиц, выделяемых на основе пауз, логического ударения и порядка слов. Каждый сегмент характеризуется собственным коммуникативным заданием: тема (исходная информация), рема (новая информация), вводные и уточняющие конструкции.

Ключевое отличие линейно-сегментной модели от традиционных синтаксических деревьев состоит в том, что она не предполагает жёсткой иерархии между компонентами предложения. Вместо этого акцент делается на последовательности развёртывания мысли говорящим. Например, в русском языке порядок слов «На столе лежит книга» и «Книга лежит на столе» описывается разными сегментными схемами, хотя дерево зависимостей у них будет одинаковым.

Линейно-сегментная модель активно применялась при описании русского языка, поскольку он обладает относительно свободным порядком слов, который невозможно объяснить исключительно синтаксическими правилами без обращения к коммуникативным факторам. В работах отечественных лингвистов, таких как И. И. Ковтунова и О. Б. Сиротинина, сегментация предложения связывалась с актуальным членением — противопоставлением темы и ремы.

Латентно-семантическая модель

Латентно-семантическая модель (LSA) представляет собой математический метод анализа текстов, основанный на сингулярном разложении матрицы «термин—документ». Исходная матрица частот встречаемости слов в документах подвергается понижению размерности, что позволяет выявить скрытые тематические факторы, связывающие слова, которые никогда не встречаются вместе в одном тексте, но употребляются в сходных контекстах.

Процедура построения LS-модели включает несколько этапов:

  • построение матрицы частот терминов по документам корпуса;
  • нормализация весов (обычно с использованием энтропийных коэффициентов);
  • сингулярное разложение матрицы;
  • усечение размерности до нескольких сотен латентных факторов;
  • вычисление косинусной меры близости между векторами слов и документов в новом пространстве.

Главное преимущество латентно-семантической модели перед простым подсчётом совпадений ключевых слов заключается в способности разрешать синонимию и полисемию. Если пользователь вводит запрос «автомобиль», модель найдёт документы, содержащие слово «машина», при условии, что оба слова встречаются в сходных контекстах в обучающем корпусе.

Применение LS-моделей

В обработке естественного языка

Латентно-семантические модели применяются для автоматического реферирования, классификации документов, фильтрации спама и построения тематических рубрикаторов. В системах информационного поиска LSA используется как метод латентно-семантического индексирования (Latent Semantic Indexing, LSI), позволяющий повысить полноту поиска за счёт учёта смысловой близости терминов.

Вопросно-ответные системы и чат-боты используют LS-модели для сопоставления пользовательского вопроса с базой знаний. Модель позволяет определить, что вопрос «Какова температура плавления железа?» семантически близок к документу, содержащему фразу «железо плавится при 1538 °C», несмотря на отсутствие точного совпадения слов.

В лингвистических исследованиях

Линейно-сегментная модель применяется при анализе устной речи, изучении просодии и интонации. С её помощью описываются закономерности постановки пауз в спонтанных монологах и диалогах, исследуется связь между сегментацией и синтаксической структурой. В корпусной лингвистике разметка текстов по сегментам используется для создания обучающих материалов по русскому языку как иностранному.

В психолингвистике

Латентно-семантическая модель используется для моделирования процессов понимания текста человеком. Исследования Т. Ландауэра показали, что оценки близости слов, полученные с помощью LSA, коррелируют с результатами экспериментальных тестов на семантические ассоциации у испытуемых. Это позволяет использовать LS-модели как приближённую модель ментального лексикона.

Ограничения и критика

Латентно-семантическая модель имеет ряд существенных ограничений. Она не учитывает порядок слов в предложении, что делает её малопригодной для анализа синтаксиса. Модель чувствительна к размеру и составу обучающего корпуса: при недостаточном объёме данных латентные факторы оказываются статистически неустойчивыми. Кроме того, LSA оперирует только поверхностной формой слова, не различая омонимы без дополнительной обработки.

Линейно-сегментная модель в синтаксисе подвергалась критике за недостаточную формализацию: критерии выделения сегментов часто опираются на интроспекцию исследователя и трудно поддаются алгоритмизации. В связи с этим в современной компьютерной лингвистике предпочтение отдаётся деревьям зависимостей, которые легче автоматически строить и использовать в машинном обучении.

Современное состояние

С развитием нейросетевых методов, в частности трансформеров и векторных представлений слов (word embeddings), классические LS-модели уступили место более мощным архитектурам, таким как BERT и GPT. Тем не менее принципы, заложенные в латентно-семантическом анализе, — представление смысла через контекст и понижение размерности — легли в основу современных методов эмбеддингов. Линейно-сегментный подход продолжает использоваться в русистике при описании коммуникативной организации предложения и в преподавании русского языка.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →