ruGPT-3
ruGPT-3 — это семейство нейросетевых языковых моделей, разработанных российской компанией «Сбер» для генерации и обработки текстов на русском языке. Модели основаны на архитектуре трансформеров (GPT — Generative Pre-trained Transformer) и предназначены для задач, связанных с пониманием и порождением естественного языка, включая написание текстов, ответы на вопросы, перевод, реферирование и диалоговое взаимодействие.
История создания
Разработка ruGPT-3 началась в 2020 году в рамках стратегии «Сбера» по созданию технологий искусственного интеллекта (ИИ) для внутренних и внешних продуктов. Предшественником модели стала ruGPT-2, выпущенная в 2021 году, которая имела 1,5 миллиарда параметров и продемонстрировала способность генерировать связные тексты на русском языке. В 2022 году «Сбер» представил ruGPT-3 — более крупную и производительную версию, обученную на значительно бо́льшем объёме данных.
Модель была обучена на корпусе текстов, включающем книги, статьи, новости, веб-страницы и другие источники на русском языке. Общий объём обучающих данных составил около 600 гигабайт текста, что эквивалентно примерно 300 миллиардам токенов (слов или их частей). Для обучения использовались суперкомпьютеры «Сбера» (например, «Кристофари»), оснащённые графическими процессорами NVIDIA.
Архитектура и параметры
ruGPT-3 относится к классу авторегрессионных языковых моделей, предсказывающих следующее слово в последовательности на основе предыдущих. Модель использует архитектуру трансформера с механизмом самовнимания (self-attention), что позволяет учитывать контекст на больших расстояниях.
Ключевые характеристики:
- Количество параметров: 1,3 миллиарда (существуют также версии с 350 миллионами и 6,7 миллиарда параметров, но основная — 1,3B).
- Максимальная длина контекста: 2048 токенов.
- Количество слоёв: 24.
- Размер эмбеддингов: 1280.
- Количество голов внимания: 16.
Модель обучена с использованием оптимизатора Adam и функции потерь кросс-энтропии. В процессе обучения применялись техники регуляризации, включая dropout и weight decay.
Версии и модификации
Семейство ruGPT-3 включает несколько вариантов, адаптированных под разные задачи:
- ruGPT-3 Small (350 миллионов параметров) — облегчённая версия для быстрого выполнения задач на устройствах с ограниченными ресурсами.
- ruGPT-3 Base (1,3 миллиарда параметров) — основная модель, используемая для большинства приложений.
- ruGPT-3 Large (6,7 миллиарда параметров) — наиболее мощная версия, требующая значительных вычислительных мощностей, но обеспечивающая лучшее качество генерации.
Кроме того, существуют специализированные модели, дообученные на определённых доменах (например, юридические тексты, медицинские данные, литература).
Обучение и данные
Обучение ruGPT-3 проводилось на корпусе, собранном из открытых источников: русскоязычные разделы Wikipedia, новостные ленты, художественная и научно-популярная литература, форумы, блоги, а также синтезированные данные. Для предобработки текстов применялись фильтры для удаления мусора, дубликатов и нецензурной лексики.
Процесс обучения занял несколько недель на кластере из 1000+ графических процессоров NVIDIA V100 и A100. Общее количество шагов обучения составило около 1 миллиона, с размером батча 256 последовательностей.
Применение
ruGPT-3 используется в различных сферах:
- Генерация текстов: создание статей, рассказов, рекламных объявлений, сценариев.
- Чат-боты и виртуальные ассистенты: модели интегрированы в продукты «Сбера» (например, виртуальный ассистент «Салют»).
- Обработка естественного языка: анализ тональности, извлечение сущностей, классификация текстов.
- Перевод и реферирование: автоматический перевод между русским и другими языками, краткое изложение содержания.
- Образование: генерация учебных материалов, проверка сочинений, помощь в изучении языков.
- Научные исследования: модели используются для анализа больших массивов текстов, генерации гипотез.
Сравнение с аналогами
ruGPT-3 является российской альтернативой зарубежным моделям, таким как GPT-3 от OpenAI и BLOOM. В отличие от GPT-3, которая оптимизирована в первую очередь для английского языка, ruGPT-3 демонстрирует лучшее качество на русскоязычных текстах благодаря целевому обучению. Однако по размеру (1,3 миллиарда параметров против 175 миллиардов у GPT-3) и объёму обучающих данных ruGPT-3 уступает зарубежным аналогам, что сказывается на сложности и разнообразии генерируемых текстов.
Критика и ограничения
Как и другие языковые модели, ruGPT-3 подвержена ряду недостатков:
- Галлюцинации: модель может генерировать факты, не соответствующие действительности, особенно в областях, требующих точных знаний (медицина, право).
- Предвзятость: обучение на данных из интернета приводит к воспроизведению стереотипов, предрассудков и нежелательного контента.
- Ограниченный контекст: длина контекста в 2048 токенов недостаточна для работы с длинными документами или сложными диалогами.
- Вычислительные затраты: даже версия Base требует значительных ресурсов для инференса (запуска модели), что ограничивает её использование на мобильных устройствах.
Развитие и перспективы
После выхода ruGPT-3 «Сбер» продолжил развитие линейки: в 2023 году была представлена модель ruGPT-3.5 с улучшенной архитектурой и увеличенным контекстом (до 4096 токенов). В 2024 году анонсирована ruGPT-4, которая, по заявлениям разработчиков, превосходит предшественницу по качеству генерации и способности к решению сложных задач. Кроме того, «Сбер» открыл доступ к некоторым версиям модели через платформу Hugging Face и собственный API.
Источники
- «Сбер» представил ruGPT-3 — крупнейшую языковую модель на русском языке. — Пресс-релиз Сбера, 2022.
- Документация по модели ruGPT-3 на Hugging Face.
- Статья «Языковые модели Сбера: от ruGPT-2 до ruGPT-4» на Habr.
- Отчёт об обучении и тестировании ruGPT-3, опубликованный на GitHub.
- Сравнительный анализ языковых моделей для русского языка, 2023.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →