Чат GPT как языковая модель¶
Чат GPT (от англ. Chat Generative Pre-trained Transformer) — это тип диалогового интерфейса на основе больших языковых моделей, генерирующих текст в формате беседы. Под этим названием чаще всего подразумевают сервис ChatGPT, выпущенный американской компанией OpenAI, а также аналогичные чат-боты других разработчиков, включая российские. Класс таких систем относится к генеративному искусственному интеллекту и работает на архитектуре трансформер.
¶История
Основой для подобных систем стала архитектура трансформер, предложенная в 2017 году в статье «Attention Is All You Need» исследователями Google. В 2018–2020 годах OpenAI последовательно выпустила серию моделей GPT (GPT-1, GPT-2, GPT-3), обучавшихся на больших массивах текстов из интернета. В ноябре 2022 года появился публичный чат-интерфейс ChatGPT на базе GPT-3.5, который за несколько месяцев привлёк сотни миллионов пользователей. В 2023 году вышла модель GPT-4, а затем её усовершенствованные версии. Параллельно собственные диалоговые модели стали разрабатывать другие компании и страны, в том числе в России.
¶Принцип работы
Модель обучается предсказывать следующее слово (точнее, токен) в последовательности текста. На первом этапе используется предобучение на огромных корпусах текста без разметки, на втором — дообучение с участием человека (RLHF, обучение с подкреплением на основе обратной связи). В ходе диалога система не «понимает» смысл в человеческом значении, а статистически подбирает наиболее вероятные продолжения с учётом контекста.
Ключевые характеристики:
- генерация связного текста на естественном языке;
- удержание контекста в пределах одной сессии;
- способность выполнять перевод, summarization, написание кода, ответы на вопросы;
- ограниченность знаний датой обучения модели.
¶Применение
Диалоговые модели применяются в самых разных сферах:
- образование — объяснение тем, помощь в подготовке;
- программирование — генерация и отладка кода;
- тексты — черновики, редактура, перевод;
- поддержка пользователей — чат-боты служб;
- аналитика — обработка и структурирование данных.
В России на фоне ограничения доступа к зарубежным сервисам развиваются собственные аналоги. Среди них — модели «YandexGPT» (компания «Яндекс»), «GigaChat» (ПАО «Сбербанк») и ряд других. Они ориентированы на русскоязычные задачи и локальное законодательство.
¶Ограничения и критика
Системы такого класса подвержены «галлюцинациям» — генерации правдоподобных, но неверных сведений. Они могут воспроизводить предвзятости, содержащиеся в обучающих данных, а также использоваться для создания недостоверной информации. Существуют вопросы авторского права на тексты, использованные при обучении. Кроме того, обсуждается влияние на рынок труда и риски, связанные с приватностью данных пользователей.
¶Регулирование
В разных странах подход к регулированию различается. В Европейском союзе действует AI Act, классифицирующий системы ИИ по уровню риска. В России в 2024 году принят закон, регулирующий разработку и применение технологий искусственного интеллекта, а также действуют требования к обработке персональных данных. Отдельные страны вводили временные ограничения на доступ к зарубежным сервисам.
¶Интересные факты
- Название GPT расшифровывается как «генеративный предобученный трансформер».
- Число параметров моделей выросло с сотен миллионов до сотен миллиардов.
- Публичный запуск ChatGPT в 2022 году стал одним из самых быстро распространявшихся интернет-сервисов в истории.
- Модели обучаются на текстах, включающих книги, статьи, код и веб-страницы.
Источники: публикации OpenAI, статья «Attention Is All You Need», материалы «Яндекса» и «Сбербанка», обзоры по большим языковым моделям.