Нейросетевой перевод текста¶
Нейросетевой перевод — метод машинного перевода, основанный на применении искусственных нейронных сетей для автоматического преобразования текста с одного языка на другой. В отличие от статистических и правиловых подходов, нейросетевые системы строят перевод на основе обученных на больших двуязычных корпусах моделей, способных учитывать контекст целиком, а не отдельные фразы. С середины 2010-х годов нейросетевой подход стал доминирующим в машинном переводе и вытеснил прежние методы в большинстве коммерческих и исследовательских систем.
¶История развития
¶Ранние нейросетевые модели
Первые работы по использованию нейронных сетей для перевода относятся к 1990-м годам, однако они уступали статистическим моделям по качеству и не получили распространения. Переломным стал 2014 год, когда исследователи Google Brain опубликовали статью о применении рекуррентных нейронных сетей (RNN) с механизмом внимания (attention) для машинного перевода. Механизм внимания позволил модели «фокусироваться» на разных частях исходного предложения при генерации каждого слова перевода, что существенно повысило качество.
¶Взрывной рост качества (2016–2017)
В 2016 году Google объявил о переходе на нейросетевой перевод в Google Переводчике, заменив прежнюю статистическую систему. В 2017 году появилась архитектура Transformer, предложенная исследователями Google в статье «Attention Is All You Need». Она полностью отказалась от рекуррентных связей, используя механизм самовнимания (self-attention) и параллельную обработку, что ускорило обучение и позволило масштабировать модели. Transformer стал основой практически всех современных систем перевода.
¶Устройство и принцип работы
¶Архитектура «кодер-декодер»
Большинство нейросетевых переводчиков построены по схеме «кодер-декодер». Кодер преобразует исходное предложение в последовательность числовых векторов (эмбеддингов), отражающих его смысл. Декодер на основе этих векторов генерирует предложение на целевом языке, выбирая слова одно за другим. Механизм внимания связывает элементы выхода декодера с элементами входа кодера, позволяя модели учитывать соответствия между языками.
¶Обучение на параллельных корпусах
Нейросетевые переводчики обучаются на огромных параллельных корпусах — коллекциях текстов, где каждому предложению на одном языке соответствует перевод на другом. В качестве обучающих данных используются, например, параллельные тексты ООН, Европейского парламента, а также данные из интернета. Обучение заключается в подборе параметров модели так, чтобы она максимизировала вероятность правильного перевода. Качество модели существенно зависит от объёма и качества обучающих данных.
¶Статистическая оценка качества
Качество нейросетевого перевода измеряется автоматическими метриками, основными из которых являются BLEU (Bilingual Evaluation Understudy) и COMET. BLEU сравнивает машинный перевод с эталонными переводами по совпадению n-грамм. Метрика COMET, появившаяся позднее, использует нейросетевые модели для оценки близости смысла и, как показывают исследования, лучше коррелирует с человеческой оценкой.
¶Основные системы и разработчики
| Система | Разработчик | Особенности |
|---|---|---|
| Google Переводчик | Один из первых крупных переходов на Transformer | |
| Yandex.Переводчик | Яндекс | Обучен на русскоязычных и параллельных корпусах, поддерживает языковые пары с русским |
| DeepL | DeepL GmbH (Германия) | Известен высоким качеством перевода европейских языков |
| Bing Translator | Microsoft | Использует архитектуру Transformer в составе сервисов Microsoft |
В России крупнейшим разработчиком нейросетевых переводчиков является Яндекс. Система Yandex.Переводчик работает с десятками языков и опирается на собственные нейросетевые модели, обученные на русскоязычных данных. Также в России ведутся исследования в области перевода для языков народов России и для редких языков с ограниченными корпусами.
¶Применение
Нейросетевой перевод применяется в массовых онлайн-сервисах, в локализации программного обеспечения и веб-сайтов, в обработке документов, в туризме и в международной коммуникации. Отдельную нишу занимают системы перевода в реальном времени — в видеочате, на переговорах, в мобильных приложениях с камерой. Нейросетевые модели также используются как компонент более широких языковых моделей, способных выполнять не только перевод, но и резюмирование, ответы на вопросы и генерацию текста.
¶Ограничения
Несмотря на высокое качество на типичных текстах, нейросетевые переводчики допускают ошибки в специализированных областях — юридической, медицинской, технической терминологии. Модели склонны к «галлюцинациям» — генерации правдоподобных, но неверных переводов, особенно на низкоресурсных языках. Качество перевода существенно падает при работе с разговорной речью, идиомами и культурно-зависимыми выражениями. Полностью автоматический перевод по-прежнему не заменяет профессионального переводчика в ответственных контекстах.
¶Источники
- Sutskever I., Vinyals O., Le Q. V. Sequence to Sequence Learning with Neural Networks, 2014
- Bahdanau D., Cho K., Bengio Y. Neural Machine Translation by Jointly Learning to Align and Translate, 2014
- Vaswani A. et al. Attention Is All You Need, 2017
- Koehn P. Neural Machine Translation, Cambridge University Press, 2020
- Материалы документации Google Cloud Translation, Microsoft Translator, Yandex Cloud