Открыть сервис

Языки с низкими ресурсами

Языки с низкими ресурсами (англ. low-resource languages) — это языки, для которых отсутствуют или крайне ограничены цифровые лингвистические ресурсы: корпуса текстов, словари, грамматические описания, размеченные данные для машинного обучения, системы распознавания и синтеза речи. Такие языки противопоставляются «языкам с высокими ресурсами» (high-resource languages), для которых подобные ресурсы существуют в больших объёмах (например, английский, русский, китайский, испанский). Понятие является относительным и зависит от контекста: один и тот же язык может считаться высокоресурсным в одной области (например, в машинном переводе) и низкоресурсным — в другой (например, в распознавании диалектной речи).

История и контекст

Термин «языки с низкими ресурсами» вошёл в активное употребление в 2010-х годах, с развитием методов машинного обучения, особенно нейросетевых подходов, требующих больших объёмов размеченных данных. До этого лингвистическая документация таких языков велась преимущественно в рамках полевой лингвистики, составления грамматик и словарей, а цифровые ресурсы были единичными. В 1990-х — 2000-х годах, с распространением интернета, началось создание корпусов для ряда языков, но большинство из них остались за пределами цифровой среды.

Ключевым рубежом стало развитие технологий обработки естественного языка (NLP) в 2010-х годах. Модели, основанные на трансформерах (например, BERT, GPT), показали высокую эффективность, но требовали для обучения корпусов объёмом в миллиарды токенов. Для большинства языков мира такие объёмы данных недоступны. Это привело к осознанию «цифрового разрыва»: по оценкам ЮНЕСКО, около 40 % из примерно 7000 языков мира находятся под угрозой исчезновения, и многие из них не имеют никакого цифрового присутствия.

Классификация

Языки с низкими ресурсами не образуют однородной группы. Их можно классифицировать по степени обеспеченности ресурсами и по причинам дефицита.

По степени ресурсной обеспеченности

  • Языки с нулевыми ресурсами (zero-resource languages): не имеют ни одного цифрового корпуса, словаря или грамматического описания в машиночитаемом виде. Примеры: многие языки Амазонии, Папуа — Новой Гвинеи, Сибири.
  • Языки с очень низкими ресурсами: имеют несколько сотен или тысяч предложений, небольшой словарь (до нескольких тысяч слов), но отсутствуют размеченные данные для задач NLP. Примеры: многие языки коренных народов России (например, эвенкийский, нивхский, ительменский).
  • Языки с низкими ресурсами: имеют корпус объёмом до нескольких миллионов слов, базовые словари, возможно, один-два параллельных корпуса для машинного перевода. Примеры: татарский, башкирский, чеченский, чувашский, а также многие языки Африки (например, суахили, хауса) и Азии (например, бирманский, кхмерский).

По причинам дефицита

  • Языки с малым числом носителей: ресурсы ограничены из-за малочисленности сообщества, отсутствия письменности или её недавнего создания.
  • Языки с большим числом носителей, но слабой цифровой поддержкой: например, панджаби (около 100 млн носителей) имеет относительно мало цифровых ресурсов по сравнению с английским или русским. Аналогично — урду, тамильский, амхарский.
  • Языки, находящиеся под угрозой исчезновения: ресурсы могут быть фрагментарными, созданными в рамках документации исчезающих языков.

Характеристики и проблемы

Основные проблемы

  1. Недостаток данных для машинного обучения: большинство современных NLP-моделей (нейросети, трансформеры) требуют десятков и сотен гигабайт текста. Для низкоресурсных языков доступны лишь единицы или десятки мегабайт.
  2. Отсутствие размеченных данных: для обучения моделей распознавания речи, машинного перевода, анализа тональности необходимы размеченные корпуса (с транскрипцией, переводами, метками). Их создание трудоёмко и дорого.
  3. Лингвистическое разнообразие: низкоресурсные языки часто обладают сложной морфологией, нестандартной фонетикой, тональностью, что затрудняет адаптацию методов, разработанных для европейских языков.
  4. Отсутствие стандартизации письменности: многие языки используют несколько систем письма (кириллица, латиница, арабица) или не имеют общепринятой орфографии.
  5. Цифровой разрыв: носители низкоресурсных языков часто имеют ограниченный доступ к интернету и цифровым устройствам, что затрудняет сбор данных.

Подходы к решению

  • Мультиязычное обучение (multilingual learning): обучение моделей на данных нескольких языков одновременно, что позволяет переносить знания с высокоресурсных языков на низкоресурсные. Примеры: mBERT, XLM-R, модели семейства NLLB (No Language Left Behind).
  • Перенос обучения (transfer learning): предобучение модели на большом корпусе высокоресурсного языка, а затем дообучение на малом корпусе целевого языка.
  • Создание синтетических данных: генерация текстов с помощью языковых моделей, обратный перевод (back-translation), использование правил для расширения корпуса.
  • Краудсорсинг и сообщества: сбор данных через онлайн-платформы (например, Common Voice от Mozilla, WikiTongues), участие носителей в разметке.
  • Лингвистическая документация: создание корпусов, словарей, грамматик в рамках полевых исследований, проектов по сохранению языков (например, Endangered Languages Project, ELAR).

Применение

Языки с низкими ресурсами являются объектом исследований в области компьютерной лингвистики, машинного обучения, документации и сохранения языков. Основные направления применения:

  • Машинный перевод: создание систем перевода для языков, не охваченных коммерческими сервисами (Google Translate, Яндекс.Переводчик). Примеры: перевод с русского на языки народов России (татарский, башкирский, чеченский).
  • Распознавание и синтез речи: разработка голосовых интерфейсов, систем диктовки, озвучивания текста для языков с низкими ресурсами.
  • Автоматическая обработка текстов: анализ тональности, извлечение информации, классификация документов для языков, не имеющих развитой цифровой инфраструктуры.
  • Образование и сохранение языка: создание цифровых учебных материалов, словарей, корпусов для поддержки изучения и сохранения исчезающих языков.

Примеры

Языки народов России

Многие языки народов России относятся к категории низкоресурсных. По данным Института языкознания РАН, из более чем 150 языков, на которых говорят в России, лишь около 20 имеют сколько-нибудь значимые цифровые ресурсы. К низкоресурсным относятся:

  • Языки Сибири и Дальнего Востока: эвенкийский, эвенский, нанайский, чукотский, корякский, ительменский, нивхский, юкагирский, кетский.
  • Языки Урала и Поволжья: марийский (луговой и горный), удмуртский, коми-зырянский, коми-пермяцкий, мордовские (эрзянский и мокшанский).
  • Языки Кавказа: аварский, даргинский, лезгинский, лакский, табасаранский, адыгейский, кабардино-черкесский, ингушский, чеченский (последний имеет относительно больше ресурсов, но всё ещё считается низкоресурсным).
  • Языки Севера: ненецкий, хантыйский, мансийский, саамские языки.

Языки других регионов

  • Африка: суахили, хауса, йоруба, игбо, амхарский, сомалийский, зулу, коса.
  • Азия: бирманский, кхмерский, лаосский, непальский, сингальский, тамильский, урду, панджаби.
  • Океания: многие языки Папуа — Новой Гвинеи (около 800 языков), Вануату, Соломоновых Островов.
  • Америка: кечуа, аймара, гуарани, науатль, майяские языки, языки коренных народов Северной Америки (навахо, чероки, инуктитут).

Критика и перспективы

Термин «языки с низкими ресурсами» подвергается критике за то, что он определяет языки исключительно через призму их цифровой обеспеченности и пригодности для машинного обучения. Критики отмечают, что такой подход игнорирует лингвистическое, культурное и социальное богатство этих языков, а также их устную традицию. Кроме того, акцент на создании ресурсов для NLP может отвлекать усилия от более фундаментальных задач документации и сохранения языков, особенно находящихся под угрозой исчезновения.

Перспективы развития связаны с несколькими направлениями:

  • Развитие методов обучения с малым количеством данных (few-shot, zero-shot learning): модели, способные обучаться на десятках или сотнях примеров.
  • Улучшение мультиязычных моделей: расширение покрытия до тысяч языков (проекты NLLB, M2M-100, XTREME).
  • Создание открытых платформ для сбора и разметки данных: инициативы Common Voice, Masakhane (для африканских языков), WikiTongues, проекты по документации языков коренных народов.
  • Вовлечение сообществ носителей: разработка инструментов, которые могут быть использованы самими носителями для создания ресурсов, обучения моделей и сохранения языка.

Источники

  • ЮНЕСКО. «Атлас языков мира, находящихся под угрозой исчезновения». 2010.
  • Институт языкознания РАН. «Языки народов России: состояние и перспективы цифровой поддержки». 2020.
  • Ruder, S. «A Survey of Cross-lingual NLP». 2020.
  • Joshi, P. et al. «The State and Fate of Linguistic Diversity in the NLP World». Proceedings of ACL, 2020.
  • Common Voice. Mozilla Foundation.
  • NLLB Team. «No Language Left Behind: Scaling Human-Centered Machine Translation». Meta (организация признана экстремистской, деятельность запрещена в РФ) AI, 2022.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →