Открыть сервисСервис

Дообучение нейросетей

Дообучение (fine-tuning) — метод адаптации предварительно обученной модели машинного обучения к конкретной задаче или предметной области путём продолжения обучения на небольшом специализированном наборе данных. В отличие от обучения с нуля (pre-training), дообучение использует уже сформированные веса модели, что позволяет существенно сократить объём вычислений и данных, необходимых для достижения высокой точности.

Общие сведения

Дообучение основано на принципе трансферного обучения: знания, приобретённые моделью на большом общем наборе данных, переносятся на новую задачу. Обычный цикл состоит из двух этапов:

  1. Предварительное обучение (pre-training) — модель обучается на масштабном корпусе данных (тексты, изображения, звук) и учится выделять общие закономерности: грамматику, семантику, визуальные признаки.
  2. Дообучение (fine-tuning) — веса модели уточняются на небольшом размеченном наборе данных целевой задачи.

Дообучение применяется в естественных языковых моделях (классификация текстов, суммаризация, машинный перевод, генерация ответов), компьютерном зрении (распознавание объектов, сегментация), речевых технологиях и других областях.

Методы дообучения

Полное дообучение

При полном дообучении обновляются все параметры модели. Метод обеспечивает максимальную адаптацию, но требует значительных вычислительных ресурсов и склонен к переобучению на малых выборках. Для больших языковых моделей с миллиардами параметров полное дообучение часто экономически нецелесообразно.

Адаптивное дообучение (LoRA)

Low-Rank Adaptation (LoRA) — метод, при котором к слоям модели добавляются низкоранговые матрицы адаптации, а исходные веса замораживаются. Обучается лишь малая доля параметров (обычно менее 1 %), что снижает требования к памяти и позволяет хранить несколько адаптаций для одной базовой модели. LoRA получила широкое распространение в 2022–2023 годах после публикаций исследователей Microsoft.

Prompt tuning и адаптация промптов

Вместо изменения весов модели оптимизируются небольшие векторы (prompt embeddings), добавляемые к входному запросу. Метод особенно эффективен для очень больших моделей, где обучение весов практически невозможно.

QLoRA и квантование

QLoRA сочетает квантование базовой модели (например, до 4 бит) с обучением адаптаций LoRA, что позволяет дообучать модели с десятками миллиардов параметров на одном GPU.

Данные для дообучения

Качество дообучения определяется прежде всего качеством целевого набора данных. Типичные источники:

  • размеченные датасеты (аннотированные тексты, подписи к изображениям);
  • внутренние данные организаций (переписка, документы, базы знаний);
  • синтетические данные, сгенерированные более сильной моделью;
  • данные, полученные методом RLHF (обучение с подкреплением на основе обратной связи человека), применяемое для выравнивания поведения модели с предпочтениями пользователя.

Объём данных для дообучения обычно на порядки меньше, чем для предварительного обучения: от сотен до десятков тысяч примеров.

Применение

Дообучение широко используется в промышленности и науке:

  • Классификация и извлечение информации — дообучение BERT-подобных моделей для задач анализа документов, определения тональности, извлечения сущностей.
  • Медицинская диагностика — адаптация свёрточных сетей к рентгеновским снимкам, снимкам МРТ, гистологическим препаратам.
  • Юридические и финансовые системы — специализация языковых моделей на нормативных актах, отчётности, контрактах.
  • Голосовые ассистенты — дообучение распознавания речи на специфическую лексику, акценты, шумовые условия.
  • Промышленная диагностика — анализ показаний датчиков, предиктивное обслуживание оборудования.

В России дообучение применяется при разработке отечественных языковых моделей, включая системы обработки русского языка, задачи документооборота и государственных информационных систем.

Ограничения

Дообучение имеет ряд ограничений:

  • Катастрофическое забывание — при обучении на узком наборе данных модель может утрачивать общие способности, приобретённые на предварительном этапе.
  • Переобучение — на малых выборках модель запоминает шум вместо закономерностей.
  • Качество и смещения данных — ошибки и перекосы в целевом наборе данных переносятся в модель.
  • Стоимость — даже адаптивные методы требуют вычислительных ресурсов и инженерной экспертизы.

Для борьбы с катастрофическим забыванием применяют методы регуляризации, смешивание общих и специализированных данных, а также техники вроде Elastic Weight Consolidation.

История

Понятие дообучения оформилось в 2010-х годах в контексте transfer learning. Ключевым событием стал выпуск модели BERT (Google, 2018), показавшей эффективность предварительного обучения и последующего дообучения для широкого круга языковых задач. В 2019–2020 годах дообучение GPT-подобных моделей стало стандартной практикой при создании специализированных ассистентов. Появление LoRA в 2021 году и QLoRA в 2023 году сделало дообучение доступным для исследователей с ограниченными ресурсами.

Источники

  • Devlin J. et al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, 2018.
  • Hu E. J. et al. LoRA: Low-Rank Adaptation of Large Language Models, 2021.
  • Dettmers T. et al. QLoRA: Efficient Finetuning of Quantized LLMs, 2023.
  • Goodfellow I., Bengio Y., Courville A. Deep Learning, MIT Press, 2016.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru