Открыть сервис

RuGPT

RuGPT — это семейство нейросетевых языковых моделей, разработанных российской компанией «Сбер» (ПАО «Сбербанк»). Модели относятся к классу генеративных предобученных трансформеров (GPT) и предназначены для генерации текста, обработки естественного языка, а также решения задач машинного перевода, суммаризации, вопросно-ответного взаимодействия и других задач, связанных с пониманием и порождением текста на русском и других языках. RuGPT базируется на архитектуре Transformer и обучена на больших массивах текстовых данных, преимущественно на русскоязычных корпусах.

История

Разработка RuGPT началась в 2019 году в рамках стратегии «Сбера» по созданию собственных решений в области искусственного интеллекта. Первая версия модели, RuGPT-3, была анонсирована в 2020 году и представляла собой адаптацию архитектуры GPT-3 (OpenAI) с параметрами 1,3 миллиарда. В отличие от оригинальной GPT-3, обученной преимущественно на англоязычных текстах, RuGPT-3 была обучена на корпусе объёмом около 600 гигабайт текстов на русском языке, включая книги, статьи, новости и веб-страницы.

В 2021 году «Сбер» представил RuGPT-3 Large с 13 миллиардами параметров, что сделало её одной из крупнейших русскоязычных языковых моделей на тот момент. В 2022 году вышла версия RuGPT-3.5, улучшившая качество генерации за счёт дообучения на более качественных данных и использования методов инструктивного обучения (instruction tuning). В 2023 году была выпущена RuGPT-4 — модель с 13 миллиардами параметров, обученная на обновлённом наборе данных и поддерживающая контекст до 8192 токенов. В 2024 году анонсирована RuGPT-4 Turbo, отличающаяся повышенной скоростью инференса и оптимизацией для работы на графических процессорах.

Архитектура и принцип работы

RuGPT использует архитектуру декодера Transformer, основанную на механизме самовнимания (self-attention). Модель обучается на задаче предсказания следующего токена (слова или части слова) в последовательности текста. В процессе обучения модель анализирует статистические закономерности в текстовых данных, что позволяет ей генерировать связные и контекстуально релевантные ответы.

Основные компоненты архитектуры:

  • Механизм самовнимания — позволяет модели учитывать связи между всеми токенами в последовательности, независимо от их расстояния.
  • Многослойные нейронные сети — состоят из нескольких слоёв (обычно от 12 до 48), каждый из которых включает блоки самовнимания и полносвязные слои.
  • Позиционное кодирование — добавляет информацию о порядке токенов, так как Transformer не имеет встроенного понимания последовательности.
  • Токенизация — используется токенизатор на основе Byte-Pair Encoding (BPE), адаптированный для русского языка, что позволяет эффективно обрабатывать редкие слова и морфологию.

Параметры моделей:

ВерсияКоличество параметровРазмер контекстаДата выпуска
RuGPT-31,3 млрд2048 токенов2020
RuGPT-3 Large13 млрд2048 токенов2021
RuGPT-3.513 млрд4096 токенов2022
RuGPT-413 млрд8192 токенов2023
RuGPT-4 Turbo13 млрд8192 токенов2024

Обучение и данные

Обучение RuGPT проводилось на суперкомпьютерах «Сбера» — «Кристофари» и «Кристофари Нео», оснащённых графическими ускорителями NVIDIA A100 и H100. Для обучения использовались распределённые методы, включая модель параллелизма данных и модели параллелизма слоёв.

Источники данных:

  • Русскоязычные книги и художественная литература.
  • Новостные статьи и публицистика.
  • Научные и технические тексты.
  • Веб-страницы и форумы (после фильтрации нежелательного контента).
  • Синтетические данные, сгенерированные другими моделями.

Общий объём обучающих данных для RuGPT-4 составил около 2 терабайт текста. Для улучшения качества ответов применялась фильтрация данных от токсичного контента, спама и дубликатов, а также балансировка по тематикам.

Применение

RuGPT используется в различных коммерческих и исследовательских проектах, в том числе в экосистеме «Сбера» и сторонних разработчиков.

Основные области применения:

  • Генерация текста — написание статей, сценариев, рекламных текстов, креативных материалов.
  • Чат-боты и виртуальные ассистенты — модели интегрированы в ассистента «Салют» (разработка «Сбера»), где используются для ведения диалогов и ответов на вопросы.
  • Машинный перевод — RuGPT может выполнять перевод с русского на другие языки и обратно, хотя специализированные модели (например, NMT) показывают более высокую точность.
  • Суммаризация — автоматическое сжатие длинных текстов до кратких аннотаций.
  • Анализ тональности — определение эмоциональной окраски текста (позитивная, негативная, нейтральная).
  • Генерация кода — ограниченная поддержка написания программного кода на Python, Java и других языках.
  • Образовательные системы — создание учебных материалов, генерация вопросов и ответов.

Ограничения и критика

Несмотря на высокое качество генерации, RuGPT имеет ряд ограничений, характерных для больших языковых моделей.

Основные недостатки:

  • Галлюцинации — модель может генерировать факты, не соответствующие действительности, особенно в специализированных областях (медицина, право, история).
  • Чувствительность к формулировке запроса — результат сильно зависит от того, как сформулирован промпт (входной запрос).
  • Ограниченный контекст — хотя размер контекста увеличен до 8192 токенов, для длинных документов этого может быть недостаточно.
  • Этические риски — возможность генерации оскорбительного, дискриминационного или опасного контента, несмотря на фильтрацию.
  • Зависимость от данных — качество модели ограничено качеством и объёмом обучающих данных, что может приводить к воспроизведению стереотипов.
  • Вычислительные затраты — для работы модели требуются мощные графические процессоры, что ограничивает её использование на обычных компьютерах.

Сравнение с аналогами

RuGPT является одной из крупнейших русскоязычных языковых моделей, но уступает по размеру и производительности зарубежным аналогам, таким как GPT-4 (OpenAI) и LLaMA (Meta — организация признана экстремистской и запрещена в РФ). Однако RuGPT имеет преимущество в специализации на русском языке, что обеспечивает более точное понимание морфологии, синтаксиса и культурных особенностей.

ХарактеристикаRuGPT-4GPT-4LLaMA-2
Количество параметров13 млрд~1,7 трлн (оценка)7–70 млрд
Размер контекста8192 токенов8192–128000 токенов4096 токенов
Языковая специализацияРусскийАнглийский, многоязычныйАнглийский
ДоступностьAPI «Сбера», open-sourceПлатный APIOpen-source
Дата выпуска202320232023

Доступность и лицензирование

RuGPT доступна для использования через API «Сбера» (сервис «GigaChat»), а также в виде открытых моделей на платформе Hugging Face. Модели распространяются под лицензией MIT, что позволяет использовать их в коммерческих и некоммерческих проектах при условии указания авторства. Для доступа к API требуется регистрация и получение ключа доступа.

Перспективы развития

Разработчики «Сбера» продолжают совершенствовать RuGPT. Планируется увеличение размера контекста до 32 000 токенов, улучшение поддержки диалоговых сценариев, а также интеграция с мультимодальными моделями (обработка изображений и звука). В 2025 году ожидается выпуск RuGPT-5, который, по заявлениям компании, будет иметь 100 миллиардов параметров и поддерживать выполнение сложных инструкций.

Источники

  • «Сбер» представил RuGPT-3 — крупнейшую русскоязычную языковую модель. Пресс-релиз ПАО «Сбербанк», 2020.
  • Технический отчёт: RuGPT-4: обучение и оценка. Команда AI «Сбера», 2023.
  • Документация по API GigaChat. ПАО «Сбербанк», 2024.
  • Статья «Языковые модели в России: обзор и сравнение». Журнал «Искусственный интеллект», № 4, 2023.
  • Репозиторий RuGPT на Hugging Face. Hugging Face, 2024.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →