Языки с низкими ресурсами
Языки с низкими ресурсами (англ. low-resource languages) — это языки, для которых отсутствуют или крайне ограничены цифровые лингвистические ресурсы: корпуса текстов, словари, грамматические описания, размеченные данные для машинного обучения, системы распознавания и синтеза речи. Такие языки противопоставляются «языкам с высокими ресурсами» (high-resource languages), для которых подобные ресурсы существуют в больших объёмах (например, английский, русский, китайский, испанский). Понятие является относительным и зависит от контекста: один и тот же язык может считаться высокоресурсным в одной области (например, в машинном переводе) и низкоресурсным — в другой (например, в распознавании диалектной речи).
История и контекст
Термин «языки с низкими ресурсами» вошёл в активное употребление в 2010-х годах, с развитием методов машинного обучения, особенно нейросетевых подходов, требующих больших объёмов размеченных данных. До этого лингвистическая документация таких языков велась преимущественно в рамках полевой лингвистики, составления грамматик и словарей, а цифровые ресурсы были единичными. В 1990-х — 2000-х годах, с распространением интернета, началось создание корпусов для ряда языков, но большинство из них остались за пределами цифровой среды.
Ключевым рубежом стало развитие технологий обработки естественного языка (NLP) в 2010-х годах. Модели, основанные на трансформерах (например, BERT, GPT), показали высокую эффективность, но требовали для обучения корпусов объёмом в миллиарды токенов. Для большинства языков мира такие объёмы данных недоступны. Это привело к осознанию «цифрового разрыва»: по оценкам ЮНЕСКО, около 40 % из примерно 7000 языков мира находятся под угрозой исчезновения, и многие из них не имеют никакого цифрового присутствия.
Классификация
Языки с низкими ресурсами не образуют однородной группы. Их можно классифицировать по степени обеспеченности ресурсами и по причинам дефицита.
По степени ресурсной обеспеченности
- Языки с нулевыми ресурсами (zero-resource languages): не имеют ни одного цифрового корпуса, словаря или грамматического описания в машиночитаемом виде. Примеры: многие языки Амазонии, Папуа — Новой Гвинеи, Сибири.
- Языки с очень низкими ресурсами: имеют несколько сотен или тысяч предложений, небольшой словарь (до нескольких тысяч слов), но отсутствуют размеченные данные для задач NLP. Примеры: многие языки коренных народов России (например, эвенкийский, нивхский, ительменский).
- Языки с низкими ресурсами: имеют корпус объёмом до нескольких миллионов слов, базовые словари, возможно, один-два параллельных корпуса для машинного перевода. Примеры: татарский, башкирский, чеченский, чувашский, а также многие языки Африки (например, суахили, хауса) и Азии (например, бирманский, кхмерский).
По причинам дефицита
- Языки с малым числом носителей: ресурсы ограничены из-за малочисленности сообщества, отсутствия письменности или её недавнего создания.
- Языки с большим числом носителей, но слабой цифровой поддержкой: например, панджаби (около 100 млн носителей) имеет относительно мало цифровых ресурсов по сравнению с английским или русским. Аналогично — урду, тамильский, амхарский.
- Языки, находящиеся под угрозой исчезновения: ресурсы могут быть фрагментарными, созданными в рамках документации исчезающих языков.
Характеристики и проблемы
Основные проблемы
- Недостаток данных для машинного обучения: большинство современных NLP-моделей (нейросети, трансформеры) требуют десятков и сотен гигабайт текста. Для низкоресурсных языков доступны лишь единицы или десятки мегабайт.
- Отсутствие размеченных данных: для обучения моделей распознавания речи, машинного перевода, анализа тональности необходимы размеченные корпуса (с транскрипцией, переводами, метками). Их создание трудоёмко и дорого.
- Лингвистическое разнообразие: низкоресурсные языки часто обладают сложной морфологией, нестандартной фонетикой, тональностью, что затрудняет адаптацию методов, разработанных для европейских языков.
- Отсутствие стандартизации письменности: многие языки используют несколько систем письма (кириллица, латиница, арабица) или не имеют общепринятой орфографии.
- Цифровой разрыв: носители низкоресурсных языков часто имеют ограниченный доступ к интернету и цифровым устройствам, что затрудняет сбор данных.
Подходы к решению
- Мультиязычное обучение (multilingual learning): обучение моделей на данных нескольких языков одновременно, что позволяет переносить знания с высокоресурсных языков на низкоресурсные. Примеры: mBERT, XLM-R, модели семейства NLLB (No Language Left Behind).
- Перенос обучения (transfer learning): предобучение модели на большом корпусе высокоресурсного языка, а затем дообучение на малом корпусе целевого языка.
- Создание синтетических данных: генерация текстов с помощью языковых моделей, обратный перевод (back-translation), использование правил для расширения корпуса.
- Краудсорсинг и сообщества: сбор данных через онлайн-платформы (например, Common Voice от Mozilla, WikiTongues), участие носителей в разметке.
- Лингвистическая документация: создание корпусов, словарей, грамматик в рамках полевых исследований, проектов по сохранению языков (например, Endangered Languages Project, ELAR).
Применение
Языки с низкими ресурсами являются объектом исследований в области компьютерной лингвистики, машинного обучения, документации и сохранения языков. Основные направления применения:
- Машинный перевод: создание систем перевода для языков, не охваченных коммерческими сервисами (Google Translate, Яндекс.Переводчик). Примеры: перевод с русского на языки народов России (татарский, башкирский, чеченский).
- Распознавание и синтез речи: разработка голосовых интерфейсов, систем диктовки, озвучивания текста для языков с низкими ресурсами.
- Автоматическая обработка текстов: анализ тональности, извлечение информации, классификация документов для языков, не имеющих развитой цифровой инфраструктуры.
- Образование и сохранение языка: создание цифровых учебных материалов, словарей, корпусов для поддержки изучения и сохранения исчезающих языков.
Примеры
Языки народов России
Многие языки народов России относятся к категории низкоресурсных. По данным Института языкознания РАН, из более чем 150 языков, на которых говорят в России, лишь около 20 имеют сколько-нибудь значимые цифровые ресурсы. К низкоресурсным относятся:
- Языки Сибири и Дальнего Востока: эвенкийский, эвенский, нанайский, чукотский, корякский, ительменский, нивхский, юкагирский, кетский.
- Языки Урала и Поволжья: марийский (луговой и горный), удмуртский, коми-зырянский, коми-пермяцкий, мордовские (эрзянский и мокшанский).
- Языки Кавказа: аварский, даргинский, лезгинский, лакский, табасаранский, адыгейский, кабардино-черкесский, ингушский, чеченский (последний имеет относительно больше ресурсов, но всё ещё считается низкоресурсным).
- Языки Севера: ненецкий, хантыйский, мансийский, саамские языки.
Языки других регионов
- Африка: суахили, хауса, йоруба, игбо, амхарский, сомалийский, зулу, коса.
- Азия: бирманский, кхмерский, лаосский, непальский, сингальский, тамильский, урду, панджаби.
- Океания: многие языки Папуа — Новой Гвинеи (около 800 языков), Вануату, Соломоновых Островов.
- Америка: кечуа, аймара, гуарани, науатль, майяские языки, языки коренных народов Северной Америки (навахо, чероки, инуктитут).
Критика и перспективы
Термин «языки с низкими ресурсами» подвергается критике за то, что он определяет языки исключительно через призму их цифровой обеспеченности и пригодности для машинного обучения. Критики отмечают, что такой подход игнорирует лингвистическое, культурное и социальное богатство этих языков, а также их устную традицию. Кроме того, акцент на создании ресурсов для NLP может отвлекать усилия от более фундаментальных задач документации и сохранения языков, особенно находящихся под угрозой исчезновения.
Перспективы развития связаны с несколькими направлениями:
- Развитие методов обучения с малым количеством данных (few-shot, zero-shot learning): модели, способные обучаться на десятках или сотнях примеров.
- Улучшение мультиязычных моделей: расширение покрытия до тысяч языков (проекты NLLB, M2M-100, XTREME).
- Создание открытых платформ для сбора и разметки данных: инициативы Common Voice, Masakhane (для африканских языков), WikiTongues, проекты по документации языков коренных народов.
- Вовлечение сообществ носителей: разработка инструментов, которые могут быть использованы самими носителями для создания ресурсов, обучения моделей и сохранения языка.
Источники
- ЮНЕСКО. «Атлас языков мира, находящихся под угрозой исчезновения». 2010.
- Институт языкознания РАН. «Языки народов России: состояние и перспективы цифровой поддержки». 2020.
- Ruder, S. «A Survey of Cross-lingual NLP». 2020.
- Joshi, P. et al. «The State and Fate of Linguistic Diversity in the NLP World». Proceedings of ACL, 2020.
- Common Voice. Mozilla Foundation.
- NLLB Team. «No Language Left Behind: Scaling Human-Centered Machine Translation». Meta (организация признана экстремистской, деятельность запрещена в РФ) AI, 2022.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →