Открыть сервисСервис

Русские нейросети для текста

Русские нейросети для текста — это семейство языковых моделей и нейросетевых систем, разработанных российскими компаниями, научными центрами и стартапами, ориентированных на обработку, генерацию и анализ текста на русском языке. К ним относятся большие языковые модели (LLM), системы автоматического перевода, инструменты генерации текста, чат-боты и платформы для работы с естественным языком. Развитие русскоязычных нейросетей активизировалось после 2022 года, когда зарубежные сервисы (ChatGPT, Claude, Gemini) лишились прямого доступа на российский рынок, а также в рамках государственной программы цифровизации и поддержки отечественных ИИ-решений.

Основные российские языковые модели

YandexGPT

YandexGPT — большая языковая модель, разработанная компанией «Яндекс». Первая публичная версия представлена в 2023 году, позже вышли YandexGPT 2 и YandexGPT Pro. Модель интегрирована в ассистента «Алису», поисковую систему «Яндекса», платформу для разработчиков YandexGPT API и облачные сервисы Yandex Cloud. Модель обучена на русскоязычных данных и ориентирована на диалоговое взаимодействие, генерацию текстов и ответы на вопросы.

GigaChat

GigaChat — языковая модель, разработанная Сбером (Сбербанк) совместно с лабораторией Neural Networks and Deep Learning (NWDL) и другими подразделениями. Первая версия представлена в мае 2023 года. GigaChat доступен через платформу GigaChat API, интегрирован в продукты «Сбера» (виртуальный ассистент «Салют», сервисы онлайн-банка) и используется в корпоративных проектах. Модель позиционируется как российская альтернатива ChatGPT и обучена преимущественно на русскоязычных данных.

Kandinsky и другие мультимодальные модели

«Кандинский» — семейство мультимодальных генеративных моделей, разработанных «Сбером» и Институтом искусственного интеллекта Сбербанка. Помимо генерации изображений, в линейке присутствуют модели для работы с текстом, включая задачи понимания и генерации.

RusBART и научные модели

Российские научные коллективы разработали ряд моделей, ориентированных на исследовательские задачи. Среди них — модели семейства RuBERT и FRED-T5, созданные в рамках проектов по развитию русскоязычных NLP-технологий. FRED-T5 (Fine-tuned Russian Encoder-Decoder) — открытая языковая модель, обученная на русскоязычных корпусах, доступная для исследователей и разработчиков.

Государственная поддержка и стратегия

В 2024 году Правительство РФ утвердило концепцию развития искусственного интеллекта на период до 2030 года, в которой развитие русскоязычных языковых моделей обозначено как приоритетная задача. Министерство цифрового развития, связи и массовых коммуникаций РФ проводит конкурсы и гранты на создание отечественных ИИ-систем, включая языковые модели. Законодательство также устанавливает требования к использованию русского языка в системах искусственного интеллекта, работающих на территории России.

Применение

Русскоязычные нейросети используются в широком спектре сфер:

Ограничения и вызовы

Основные сложности, с которыми сталкиваются российские разработчики языковых моделей, связаны с объёмом качественных русскоязычных обучающих данных, дефицитом вычислительных ресурсов (доступ к современным GPU ограничен санкционным режимом) и необходимостью конкурировать с крупными зарубежными моделями по качеству генерации. Эксперты отмечают, что русскоязычные модели часто демонстрируют более высокое качество на узкоспециализированных русскоязычных задачах, но уступают в универсальности и масштабе.

Источники

  • Официальные документы Минцифры России о развитии искусственного интеллекта
  • Пресс-релизы «Яндекса» о YandexGPT
  • Пресс-релизы «Сбера» о GigaChat и модели «Кандинский»
  • Публикации исследовательских групп по русскоязычным NLP-моделям (FRED-T5, RuBERT)
  • Концепция развития искусственного интеллекта в Российской Федерации до 2030 года
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru