LS-модели в языкознании¶
LS-модель (от англ. LS model, также «модель Лейкока—Шарплесса») — в лингвистике и компьютерной обработке текста обозначает формальную схему описания синтаксической структуры предложения, основанную на линейно-сегментном представлении. В более широком значении термин используется для обозначения статистических латентно-семантических моделей (Latent Semantic), применяемых в информационном поиске и анализе текстов. В зависимости от контекста аббревиатура LS может расшифровываться по-разному, что приводит к многозначности термина в научной и технической литературе.
¶История возникновения
Понятие LS-модели впервые получило распространение в конце XX века в двух независимых научных направлениях. В теоретической лингвистике советской и российской школы термин «линейно-сегментная модель» использовался для описания порядка слов и интонационного членения высказывания. Исследователи, работавшие в рамках коммуникативной грамматики, предлагали рассматривать предложение не как иерархическое дерево зависимостей, а как последовательность сегментов, каждый из которых несёт определённую коммуникативную нагрузку.
Параллельно в англоязычной компьютерной лингвистике развивалась латентно-семантическая модель (Latent Semantic Analysis, LSA), которую в сокращённом виде также называли LS-моделью. Она была предложена в 1988 году группой исследователей во главе с Томасом Ландауэром и Сьюзен Дютро в Bellcore. Эта модель предназначалась для анализа больших массивов текстов и выявления скрытых (латентных) смысловых связей между словами и документами.
¶Линейно-сегментная модель в синтаксисе
В рамках линейно-сегментного подхода предложение рассматривается как цепочка сегментов — минимальных интонационно-смысловых единиц, выделяемых на основе пауз, логического ударения и порядка слов. Каждый сегмент характеризуется собственным коммуникативным заданием: тема (исходная информация), рема (новая информация), вводные и уточняющие конструкции.
Ключевое отличие линейно-сегментной модели от традиционных синтаксических деревьев состоит в том, что она не предполагает жёсткой иерархии между компонентами предложения. Вместо этого акцент делается на последовательности развёртывания мысли говорящим. Например, в русском языке порядок слов «На столе лежит книга» и «Книга лежит на столе» описывается разными сегментными схемами, хотя дерево зависимостей у них будет одинаковым.
Линейно-сегментная модель активно применялась при описании русского языка, поскольку он обладает относительно свободным порядком слов, который невозможно объяснить исключительно синтаксическими правилами без обращения к коммуникативным факторам. В работах отечественных лингвистов, таких как И. И. Ковтунова и О. Б. Сиротинина, сегментация предложения связывалась с актуальным членением — противопоставлением темы и ремы.
¶Латентно-семантическая модель
Латентно-семантическая модель (LSA) представляет собой математический метод анализа текстов, основанный на сингулярном разложении матрицы «термин—документ». Исходная матрица частот встречаемости слов в документах подвергается понижению размерности, что позволяет выявить скрытые тематические факторы, связывающие слова, которые никогда не встречаются вместе в одном тексте, но употребляются в сходных контекстах.
Процедура построения LS-модели включает несколько этапов:
- построение матрицы частот терминов по документам корпуса;
- нормализация весов (обычно с использованием энтропийных коэффициентов);
- сингулярное разложение матрицы;
- усечение размерности до нескольких сотен латентных факторов;
- вычисление косинусной меры близости между векторами слов и документов в новом пространстве.
Главное преимущество латентно-семантической модели перед простым подсчётом совпадений ключевых слов заключается в способности разрешать синонимию и полисемию. Если пользователь вводит запрос «автомобиль», модель найдёт документы, содержащие слово «машина», при условии, что оба слова встречаются в сходных контекстах в обучающем корпусе.
¶Применение LS-моделей
¶В обработке естественного языка
Латентно-семантические модели применяются для автоматического реферирования, классификации документов, фильтрации спама и построения тематических рубрикаторов. В системах информационного поиска LSA используется как метод латентно-семантического индексирования (Latent Semantic Indexing, LSI), позволяющий повысить полноту поиска за счёт учёта смысловой близости терминов.
Вопросно-ответные системы и чат-боты используют LS-модели для сопоставления пользовательского вопроса с базой знаний. Модель позволяет определить, что вопрос «Какова температура плавления железа?» семантически близок к документу, содержащему фразу «железо плавится при 1538 °C», несмотря на отсутствие точного совпадения слов.
¶В лингвистических исследованиях
Линейно-сегментная модель применяется при анализе устной речи, изучении просодии и интонации. С её помощью описываются закономерности постановки пауз в спонтанных монологах и диалогах, исследуется связь между сегментацией и синтаксической структурой. В корпусной лингвистике разметка текстов по сегментам используется для создания обучающих материалов по русскому языку как иностранному.
¶В психолингвистике
Латентно-семантическая модель используется для моделирования процессов понимания текста человеком. Исследования Т. Ландауэра показали, что оценки близости слов, полученные с помощью LSA, коррелируют с результатами экспериментальных тестов на семантические ассоциации у испытуемых. Это позволяет использовать LS-модели как приближённую модель ментального лексикона.
¶Ограничения и критика
Латентно-семантическая модель имеет ряд существенных ограничений. Она не учитывает порядок слов в предложении, что делает её малопригодной для анализа синтаксиса. Модель чувствительна к размеру и составу обучающего корпуса: при недостаточном объёме данных латентные факторы оказываются статистически неустойчивыми. Кроме того, LSA оперирует только поверхностной формой слова, не различая омонимы без дополнительной обработки.
Линейно-сегментная модель в синтаксисе подвергалась критике за недостаточную формализацию: критерии выделения сегментов часто опираются на интроспекцию исследователя и трудно поддаются алгоритмизации. В связи с этим в современной компьютерной лингвистике предпочтение отдаётся деревьям зависимостей, которые легче автоматически строить и использовать в машинном обучении.
¶Современное состояние
С развитием нейросетевых методов, в частности трансформеров и векторных представлений слов (word embeddings), классические LS-модели уступили место более мощным архитектурам, таким как BERT и GPT. Тем не менее принципы, заложенные в латентно-семантическом анализе, — представление смысла через контекст и понижение размерности — легли в основу современных методов эмбеддингов. Линейно-сегментный подход продолжает использоваться в русистике при описании коммуникативной организации предложения и в преподавании русского языка.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
