Открыть сервис

LLM в машинном обучении

LLM (Large Language Model, большая языковая модель) — это класс моделей машинного обучения, предназначенных для обработки, генерации и понимания естественного языка. Отличительной особенностью LLM является огромное количество параметров (от миллиардов до сотен миллиардов), что позволяет им улавливать сложные закономерности в тексте, усваивать контекст и выполнять широкий спектр задач — от перевода и суммаризации до написания кода и ведения диалога. LLM относятся к подкатегории глубоких нейронных сетей, преимущественно построенных на архитектуре трансформера.

История и предпосылки появления

Развитие LLM стало результатом эволюции методов обработки естественного языка (NLP). До эпохи глубокого обучения доминировали статистические модели (n-граммы) и классические алгоритмы машинного обучения (наивный Байес, SVM), которые требовали ручного извлечения признаков и плохо справлялись с долгосрочными зависимостями в тексте.

Ключевые этапы:

  • 2013–2014 годы: появление векторных представлений слов (word2vec, GloVe), позволяющих кодировать семантическую близость.
  • 2017 год: публикация статьи «Attention Is All You Need», представившей архитектуру трансформера. Механизм самовнимания (self-attention) позволил эффективно учитывать взаимосвязи между всеми словами в последовательности, что стало основой для последующих LLM.
  • 2018 год: выпуск модели BERT от Google, которая показала эффективность предобучения на больших корпусах текста с последующей тонкой настройкой (fine-tuning) под конкретные задачи.
  • 2019–2020 годы: появление моделей семейства GPT от OpenAI. GPT-3 (2020) с 175 млрд параметров продемонстрировала способность обучаться «в контексте» (in-context learning), выполняя задачи без обновления весов.
  • 2022–2023 годы: коммерциализация технологии через чат-интерфейсы (ChatGPT), развитие мультимодальных моделей (GPT-4, способных обрабатывать изображения), а также появление открытых альтернатив (Llama от Meta — организация признана экстремистской и запрещена в РФ, Mistral, DeepSeek).

Архитектура и принцип работы

Подавляющее большинство современных LLM построено на архитектуре трансформера, состоящей из двух основных блоков: энкодера и декодера. В зависимости от конфигурации выделяют три типа моделей:

  • Энкодерные (например, BERT) — понимают текст, но не генерируют его свободно; применяются для классификации, поиска ответов, анализа тональности.
  • Декодерные (например, GPT, Llama) — генерируют текст авторегрессионно, предсказывая следующее слово (токен) на основе предыдущих. Именно этот тип лежит в основе современных чат-ботов.
  • Энкодерно-декодерные (например, T5) — используются для задач преобразования текста (перевод, суммаризация).

Основные компоненты:

  • Механизм самовнимания: вычисляет «важность» каждого токена относительно других, позволяя модели учитывать контекст любой длины в пределах окна внимания.
  • Позиционное кодирование: добавляет информацию о порядке слов, так как самовнимание инвариантно к позиции.
  • Многослойная структура: трансформеры состоят из десятков или сотен слоёв, каждый из которых включает подуровни внимания и полносвязные нейронные сети с нелинейными функциями активации (обычно GELU или SwiGLU).
  • Нормализация слоёв и остаточные связи — для стабильного обучения очень глубоких сетей.

Обучение и данные

Процесс создания LLM включает несколько этапов:

  1. Предобучение (pre-training): модель обучается на огромных неразмеченных корпусах текста (терабайты данных из интернета, книг, научных статей). Основная задача — предсказание следующего токена (для декодерных моделей) или восстановление замаскированных слов (для энкодерных). На этом этапе модель усваивает грамматику, фактологию, стилистику и частично логику.
  2. Тонкая настройка с учителем (supervised fine-tuning, SFT): модель дообучается на размеченных парах «инструкция — правильный ответ» для улучшения следования командам.
  3. Обучение с подкреплением на основе обратной связи от людей (RLHF): специальная модель-вознаграждение оценивает ответы LLM, а сама языковая модель оптимизируется так, чтобы максимизировать оценку. Этот этап повышает полезность, безопасность и согласованность ответов с человеческими предпочтениями.

Требования к вычислительным ресурсам крайне высоки: обучение модели уровня GPT-3 требует тысяч графических процессоров (GPU) в течение нескольких месяцев. Стоимость обучения крупнейших моделей оценивается в десятки миллионов долларов США.

Основные характеристики и параметры

  • Количество параметров: от ~1 млрд (малые LLM, запускаемые локально) до 1,8 трлн (GPT-4 по неподтверждённым данным). Параметры — это веса нейронной сети, определяющие её поведение.
  • Контекстное окно: максимальная длина входной последовательности (в токенах), которую модель может обработать за раз. Современные модели поддерживают окна от 4 тыс. до 1 млн токенов (например, Gemini 1.5).
  • Токенизация: текст разбивается на токены — единицы, которые могут быть словами, частями слов или отдельными символами. Словарь типичной LLM содержит 30–100 тыс. токенов.
  • Температура — гиперпараметр, управляющий случайностью генерации: низкие значения делают вывод детерминированным, высокие — разнообразным, но менее точным.

Применение

LLM используются в широком спектре областей:

  • Информационный поиск и чат-боты: ответы на вопросы, диалоговые ассистенты, поисковые системы с генеративными ответами.
  • Обработка текста: машинный перевод, суммаризация, проверка грамматики, анализ тональности, извлечение сущностей.
  • Программирование: генерация кода по описанию, автодополнение, поиск ошибок (GitHub Copilot, Codex).
  • Образование: объяснение сложных тем, генерация учебных материалов, репетиторство.
  • Медицина и юриспруденция: помощь в анализе документации, подготовке проектов документов (при обязательном контроле специалиста).
  • Научные исследования: систематизация литературы, помощь в написании статей, обработка больших массивов текстовых данных.

Ограничения и критика

Несмотря на впечатляющие возможности, LLM имеют существенные недостатки:

  • Галлюцинации: генерация уверенных, но фактически неверных утверждений. Модель не имеет доступа к проверке фактов и опирается на вероятностные закономерности.
  • Отсутствие истинного понимания: LLM не обладают сознанием или семантическим пониманием в человеческом смысле; они работают на уровне статистических паттернов.
  • Устаревание знаний: модель обучена на данных, собранных до определённой даты, и не знает о более поздних событиях (частично решается подключением внешних инструментов поиска).
  • Предвзятость и токсичность: обучающие данные содержат предрассудки и вредоносный контент, что может воспроизводиться моделью.
  • Высокая стоимость инференса: эксплуатация крупных моделей требует значительных серверных мощностей, что ограничивает их доступность.
  • Экологические и этические проблемы: огромное потребление электроэнергии при обучении, вопросы авторских прав на сгенерированный контент, риск злоупотреблений (создание дезинформации, фишинга).

Перспективы развития

Основные направления исследований включают: повышение эффективности обучения (квантование, дистилляция, разреженные модели), увеличение длины контекста, разработку мультимодальных моделей (текст + изображение + аудио + видео), интеграцию с внешними инструментами (поиск, калькуляторы, API) для снижения галлюцинаций, а также создание моделей, способных к планированию и рассуждению. Отдельным трендом является развитие небольших моделей (7–70 млрд параметров), которые могут запускаться на локальных устройствах, обеспечивая конфиденциальность данных.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →