Фразовый SMT
Фразовый SMT (от англ. phrase-based statistical machine translation) — это подход к автоматическому переводу текста, основанный на статистических моделях, в которых единицей перевода выступает не отдельное слово, а последовательность слов (фраза). В отличие от более ранних методов пословного перевода, фразовый SMT позволяет учитывать контекст и идиоматические выражения, что значительно повышает качество перевода для языковых пар с разной грамматической структурой.
История
Развитие фразового SMT началось в конце 1990-х — начале 2000-х годов как эволюция более ранних статистических моделей, предложенных в IBM (модели IBM 1–5). В 1999 году исследователи из Университета Джонса Хопкинса (США) и Университета Карнеги-Меллона (США) представили первую реализацию фразового подхода в рамках проекта Candide. Однако ключевой прорыв произошёл в 2003 году, когда группа учёных во главе с Филиппом Кёном (Philipp Koehn) и Францем Йозефом Охом (Franz Josef Och) опубликовала работу «Statistical Phrase-Based Translation». В ней была предложена формальная модель, включающая выравнивание фраз, вероятностную оценку и декодирование.
В 2004 году Кён выпустил открытую систему Moses, которая стала стандартом де-факто для фразового SMT в академической среде и индустрии. К середине 2000-х годов фразовый SMT вытеснил пословные подходы и доминировал в коммерческих системах перевода (например, Google Translate до 2016 года, Microsoft Translator до 2017 года). С 2014 года начался переход к нейронному машинному переводу (NMT), который к 2018 году практически полностью вытеснил фразовый SMT из промышленного использования, хотя в некоторых задачах с ограниченными данными он продолжает применяться.
Основные принципы
Фраза как единица перевода
В фразовом SMT «фраза» — это не лингвистическая единица (синтаксическая группа), а произвольная непрерывная последовательность слов, которая может быть длиной от 1 до N (обычно до 7–10 слов). Например, английское «kick the bucket» может быть переведено как единая фраза «сыграть в ящик», а не пословно.
Вероятностная модель
Система фразового SMT строится на трёх основных компонентах:
- Фразовая таблица (phrase table) — хранит пары исходных и целевых фраз с вероятностями перевода. Вероятность \( p(e|f) \) оценивается по частоте встречаемости пары в параллельном корпусе.
- Модель языка (language model) — оценивает вероятность последовательности слов на целевом языке (обычно n-грамная модель). Помогает выбирать грамматически правильные варианты.
- Модель реордеринга (reordering model) — учитывает, как порядок слов в исходной фразе может меняться при переводе. Например, в русском языке прилагательное часто стоит перед существительным, а в английском — наоборот.
Декодирование
Декодер (например, в Moses) строит перевод, комбинируя фразы из таблицы, применяя модель реордеринга и оценивая результат по логарифмической сумме взвешенных вероятностей. Поиск оптимального перевода — это задача NP-трудная, поэтому используются эвристики (например, поиск по лучу — beam search).
Архитектура системы
Подготовка данных
- Параллельный корпус — набор предложений на исходном и целевом языках, выровненных по предложениям.
- Выравнивание слов — с помощью алгоритмов (например, GIZA++ на основе моделей IBM) определяются соответствия между словами в параллельных предложениях.
- Извлечение фраз — на основе выравнивания слов извлекаются все возможные пары фраз, которые согласуются с выравниванием.
- Оценка вероятностей — для каждой пары фраз вычисляются вероятности перевода (в обе стороны) и вероятности лексического веса.
Компоненты системы
- Фразовая таблица — обычно хранится в бинарном формате для быстрого доступа.
- Модель языка — строится отдельно на большом моноязычном корпусе целевого языка (например, с помощью SRILM или KenLM).
- Модель реордеринга — может быть основана на расстоянии (distance-based) или на лексических предпочтениях (lexicalized reordering).
- Декодер — принимает исходное предложение, разбивает его на фразы, комбинирует их в порядке, заданном моделью реордеринга, и выбирает наилучший перевод по комбинированной оценке.
Настройка весов
Веса компонентов (фразовая таблица, модель языка, модель реордеринга, штраф за длину фразы) настраиваются с помощью алгоритмов оптимизации (например, MERT — Minimum Error Rate Training) на небольшом наборе эталонных переводов.
Преимущества и недостатки
Преимущества
- Учёт контекста — перевод идиом, устойчивых выражений и многозначных слов значительно точнее, чем в пословных моделях.
- Относительная простота — по сравнению с синтаксическими и нейронными моделями, фразовый SMT требует меньше вычислительных ресурсов для обучения и инференса.
- Прозрачность — фразовые таблицы можно анализировать и редактировать вручную.
- Работа с малыми данными — при наличии 10–50 тысяч параллельных предложений фразовый SMT может давать приемлемое качество, тогда как нейронные модели требуют значительно больше данных.
Недостатки
- Ограниченная длина фразы — фразы длиннее 7–10 слов извлекаются редко, что ограничивает учёт глобального контекста.
- Проблемы с реордерингом — перестановка слов между языками с разным порядком (например, английский SVO и японский SOV) часто приводит к ошибкам.
- Плохая обработка морфологии — для языков с богатой морфологией (русский, финский, арабский) фразовый SMT часто порождает грамматически некорректные формы.
- Отсутствие семантики — модель не понимает смысла, только статистические закономерности.
Применение
Фразовый SMT активно использовался в следующих областях:
- Системы автоматического перевода — Google Translate (до 2016 года), Microsoft Translator (до 2017 года), Yandex.Translate (до 2017 года).
- Локализация программного обеспечения — перевод интерфейсов, документации и справок.
- Обработка патентной документации — перевод патентов с использованием специализированных корпусов.
- Поддержка переводчиков — создание черновиков перевода (post-editing) в системах CAT (Computer-Assisted Translation).
Сравнение с другими подходами
Пословный SMT
Пословный SMT (основанный на моделях IBM) переводит каждое слово независимо, что приводит к потере контекста и ошибкам в идиомах. Фразовый SMT превосходит его по качеству на 10–20% по метрике BLEU для пар языков с разной грамматикой.
Синтаксический SMT
Синтаксический SMT использует деревья зависимостей или составляющих для учёта грамматической структуры. Он может быть точнее для языков с фиксированным порядком слов, но сложнее в реализации и требует размеченных синтаксических корпусов.
Нейронный машинный перевод (NMT)
NMT (на основе архитектуры Transformer) превосходит фразовый SMT по всем метрикам качества (BLEU, TER, человеческая оценка) для большинства языковых пар, особенно при наличии больших корпусов. Однако NMT требует значительно больше вычислительных ресурсов (GPU, память) и данных. Фразовый SMT остаётся актуальным для задач с малыми ресурсами (low-resource languages) и в условиях ограниченного оборудования.
Интересные факты
- Система Moses, созданная Филиппом Кёном, до сих пор используется в некоторых исследовательских проектах и для обучения студентов-компьютерных лингвистов.
- Фразовый SMT лёг в основу многих соревновательных систем на конференциях WMT (Workshop on Machine Translation) в 2006–2015 годах.
- В 2016 году Google объявил о полном переходе на нейронный перевод (Google Neural Machine Translation), что привело к резкому снижению интереса к фразовому SMT в индустрии.
Источники
- Koehn, P., Och, F. J., & Marcu, D. (2003). Statistical phrase-based translation. Proceedings of the 2003 Conference of the North American Chapter of the Association for Computational Linguistics on Human Language Technology.
- Koehn, P. (2010). Statistical Machine Translation. Cambridge University Press.
- Och, F. J., & Ney, H. (2003). A systematic comparison of various statistical alignment models. Computational Linguistics, 29(1), 19–51.
- Moses: Open-source toolkit for statistical machine translation (Koehn et al., 2007). Proceedings of the 45th Annual Meeting of the ACL on Interactive Poster and Demonstration Sessions.
- Brown, P. F., Pietra, V. J. D., Pietra, S. A. D., & Mercer, R. L. (1993). The mathematics of statistical machine translation: Parameter estimation. Computational Linguistics, 19(2), 263–311.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →