RuGPT
RuGPT — это семейство нейросетевых языковых моделей, разработанных российской компанией «Сбер» (ПАО «Сбербанк»). Модели относятся к классу генеративных предобученных трансформеров (GPT) и предназначены для генерации текста, обработки естественного языка, а также решения задач машинного перевода, суммаризации, вопросно-ответного взаимодействия и других задач, связанных с пониманием и порождением текста на русском и других языках. RuGPT базируется на архитектуре Transformer и обучена на больших массивах текстовых данных, преимущественно на русскоязычных корпусах.
История
Разработка RuGPT началась в 2019 году в рамках стратегии «Сбера» по созданию собственных решений в области искусственного интеллекта. Первая версия модели, RuGPT-3, была анонсирована в 2020 году и представляла собой адаптацию архитектуры GPT-3 (OpenAI) с параметрами 1,3 миллиарда. В отличие от оригинальной GPT-3, обученной преимущественно на англоязычных текстах, RuGPT-3 была обучена на корпусе объёмом около 600 гигабайт текстов на русском языке, включая книги, статьи, новости и веб-страницы.
В 2021 году «Сбер» представил RuGPT-3 Large с 13 миллиардами параметров, что сделало её одной из крупнейших русскоязычных языковых моделей на тот момент. В 2022 году вышла версия RuGPT-3.5, улучшившая качество генерации за счёт дообучения на более качественных данных и использования методов инструктивного обучения (instruction tuning). В 2023 году была выпущена RuGPT-4 — модель с 13 миллиардами параметров, обученная на обновлённом наборе данных и поддерживающая контекст до 8192 токенов. В 2024 году анонсирована RuGPT-4 Turbo, отличающаяся повышенной скоростью инференса и оптимизацией для работы на графических процессорах.
Архитектура и принцип работы
RuGPT использует архитектуру декодера Transformer, основанную на механизме самовнимания (self-attention). Модель обучается на задаче предсказания следующего токена (слова или части слова) в последовательности текста. В процессе обучения модель анализирует статистические закономерности в текстовых данных, что позволяет ей генерировать связные и контекстуально релевантные ответы.
Основные компоненты архитектуры:
- Механизм самовнимания — позволяет модели учитывать связи между всеми токенами в последовательности, независимо от их расстояния.
- Многослойные нейронные сети — состоят из нескольких слоёв (обычно от 12 до 48), каждый из которых включает блоки самовнимания и полносвязные слои.
- Позиционное кодирование — добавляет информацию о порядке токенов, так как Transformer не имеет встроенного понимания последовательности.
- Токенизация — используется токенизатор на основе Byte-Pair Encoding (BPE), адаптированный для русского языка, что позволяет эффективно обрабатывать редкие слова и морфологию.
Параметры моделей:
| Версия | Количество параметров | Размер контекста | Дата выпуска |
|---|---|---|---|
| RuGPT-3 | 1,3 млрд | 2048 токенов | 2020 |
| RuGPT-3 Large | 13 млрд | 2048 токенов | 2021 |
| RuGPT-3.5 | 13 млрд | 4096 токенов | 2022 |
| RuGPT-4 | 13 млрд | 8192 токенов | 2023 |
| RuGPT-4 Turbo | 13 млрд | 8192 токенов | 2024 |
Обучение и данные
Обучение RuGPT проводилось на суперкомпьютерах «Сбера» — «Кристофари» и «Кристофари Нео», оснащённых графическими ускорителями NVIDIA A100 и H100. Для обучения использовались распределённые методы, включая модель параллелизма данных и модели параллелизма слоёв.
Источники данных:
- Русскоязычные книги и художественная литература.
- Новостные статьи и публицистика.
- Научные и технические тексты.
- Веб-страницы и форумы (после фильтрации нежелательного контента).
- Синтетические данные, сгенерированные другими моделями.
Общий объём обучающих данных для RuGPT-4 составил около 2 терабайт текста. Для улучшения качества ответов применялась фильтрация данных от токсичного контента, спама и дубликатов, а также балансировка по тематикам.
Применение
RuGPT используется в различных коммерческих и исследовательских проектах, в том числе в экосистеме «Сбера» и сторонних разработчиков.
Основные области применения:
- Генерация текста — написание статей, сценариев, рекламных текстов, креативных материалов.
- Чат-боты и виртуальные ассистенты — модели интегрированы в ассистента «Салют» (разработка «Сбера»), где используются для ведения диалогов и ответов на вопросы.
- Машинный перевод — RuGPT может выполнять перевод с русского на другие языки и обратно, хотя специализированные модели (например, NMT) показывают более высокую точность.
- Суммаризация — автоматическое сжатие длинных текстов до кратких аннотаций.
- Анализ тональности — определение эмоциональной окраски текста (позитивная, негативная, нейтральная).
- Генерация кода — ограниченная поддержка написания программного кода на Python, Java и других языках.
- Образовательные системы — создание учебных материалов, генерация вопросов и ответов.
Ограничения и критика
Несмотря на высокое качество генерации, RuGPT имеет ряд ограничений, характерных для больших языковых моделей.
Основные недостатки:
- Галлюцинации — модель может генерировать факты, не соответствующие действительности, особенно в специализированных областях (медицина, право, история).
- Чувствительность к формулировке запроса — результат сильно зависит от того, как сформулирован промпт (входной запрос).
- Ограниченный контекст — хотя размер контекста увеличен до 8192 токенов, для длинных документов этого может быть недостаточно.
- Этические риски — возможность генерации оскорбительного, дискриминационного или опасного контента, несмотря на фильтрацию.
- Зависимость от данных — качество модели ограничено качеством и объёмом обучающих данных, что может приводить к воспроизведению стереотипов.
- Вычислительные затраты — для работы модели требуются мощные графические процессоры, что ограничивает её использование на обычных компьютерах.
Сравнение с аналогами
RuGPT является одной из крупнейших русскоязычных языковых моделей, но уступает по размеру и производительности зарубежным аналогам, таким как GPT-4 (OpenAI) и LLaMA (Meta — организация признана экстремистской и запрещена в РФ). Однако RuGPT имеет преимущество в специализации на русском языке, что обеспечивает более точное понимание морфологии, синтаксиса и культурных особенностей.
| Характеристика | RuGPT-4 | GPT-4 | LLaMA-2 |
|---|---|---|---|
| Количество параметров | 13 млрд | ~1,7 трлн (оценка) | 7–70 млрд |
| Размер контекста | 8192 токенов | 8192–128000 токенов | 4096 токенов |
| Языковая специализация | Русский | Английский, многоязычный | Английский |
| Доступность | API «Сбера», open-source | Платный API | Open-source |
| Дата выпуска | 2023 | 2023 | 2023 |
Доступность и лицензирование
RuGPT доступна для использования через API «Сбера» (сервис «GigaChat»), а также в виде открытых моделей на платформе Hugging Face. Модели распространяются под лицензией MIT, что позволяет использовать их в коммерческих и некоммерческих проектах при условии указания авторства. Для доступа к API требуется регистрация и получение ключа доступа.
Перспективы развития
Разработчики «Сбера» продолжают совершенствовать RuGPT. Планируется увеличение размера контекста до 32 000 токенов, улучшение поддержки диалоговых сценариев, а также интеграция с мультимодальными моделями (обработка изображений и звука). В 2025 году ожидается выпуск RuGPT-5, который, по заявлениям компании, будет иметь 100 миллиардов параметров и поддерживать выполнение сложных инструкций.
Источники
- «Сбер» представил RuGPT-3 — крупнейшую русскоязычную языковую модель. Пресс-релиз ПАО «Сбербанк», 2020.
- Технический отчёт: RuGPT-4: обучение и оценка. Команда AI «Сбера», 2023.
- Документация по API GigaChat. ПАО «Сбербанк», 2024.
- Статья «Языковые модели в России: обзор и сравнение». Журнал «Искусственный интеллект», № 4, 2023.
- Репозиторий RuGPT на Hugging Face. Hugging Face, 2024.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →