Дообучение нейросетей¶
Дообучение (fine-tuning) — метод адаптации предварительно обученной модели машинного обучения к конкретной задаче или предметной области путём продолжения обучения на небольшом специализированном наборе данных. В отличие от обучения с нуля (pre-training), дообучение использует уже сформированные веса модели, что позволяет существенно сократить объём вычислений и данных, необходимых для достижения высокой точности.
¶Общие сведения
Дообучение основано на принципе трансферного обучения: знания, приобретённые моделью на большом общем наборе данных, переносятся на новую задачу. Обычный цикл состоит из двух этапов:
- Предварительное обучение (pre-training) — модель обучается на масштабном корпусе данных (тексты, изображения, звук) и учится выделять общие закономерности: грамматику, семантику, визуальные признаки.
- Дообучение (fine-tuning) — веса модели уточняются на небольшом размеченном наборе данных целевой задачи.
Дообучение применяется в естественных языковых моделях (классификация текстов, суммаризация, машинный перевод, генерация ответов), компьютерном зрении (распознавание объектов, сегментация), речевых технологиях и других областях.
¶Методы дообучения
¶Полное дообучение
При полном дообучении обновляются все параметры модели. Метод обеспечивает максимальную адаптацию, но требует значительных вычислительных ресурсов и склонен к переобучению на малых выборках. Для больших языковых моделей с миллиардами параметров полное дообучение часто экономически нецелесообразно.
¶Адаптивное дообучение (LoRA)
Low-Rank Adaptation (LoRA) — метод, при котором к слоям модели добавляются низкоранговые матрицы адаптации, а исходные веса замораживаются. Обучается лишь малая доля параметров (обычно менее 1 %), что снижает требования к памяти и позволяет хранить несколько адаптаций для одной базовой модели. LoRA получила широкое распространение в 2022–2023 годах после публикаций исследователей Microsoft.
¶Prompt tuning и адаптация промптов
Вместо изменения весов модели оптимизируются небольшие векторы (prompt embeddings), добавляемые к входному запросу. Метод особенно эффективен для очень больших моделей, где обучение весов практически невозможно.
¶QLoRA и квантование
QLoRA сочетает квантование базовой модели (например, до 4 бит) с обучением адаптаций LoRA, что позволяет дообучать модели с десятками миллиардов параметров на одном GPU.
¶Данные для дообучения
Качество дообучения определяется прежде всего качеством целевого набора данных. Типичные источники:
- размеченные датасеты (аннотированные тексты, подписи к изображениям);
- внутренние данные организаций (переписка, документы, базы знаний);
- синтетические данные, сгенерированные более сильной моделью;
- данные, полученные методом RLHF (обучение с подкреплением на основе обратной связи человека), применяемое для выравнивания поведения модели с предпочтениями пользователя.
Объём данных для дообучения обычно на порядки меньше, чем для предварительного обучения: от сотен до десятков тысяч примеров.
¶Применение
Дообучение широко используется в промышленности и науке:
- Классификация и извлечение информации — дообучение BERT-подобных моделей для задач анализа документов, определения тональности, извлечения сущностей.
- Медицинская диагностика — адаптация свёрточных сетей к рентгеновским снимкам, снимкам МРТ, гистологическим препаратам.
- Юридические и финансовые системы — специализация языковых моделей на нормативных актах, отчётности, контрактах.
- Голосовые ассистенты — дообучение распознавания речи на специфическую лексику, акценты, шумовые условия.
- Промышленная диагностика — анализ показаний датчиков, предиктивное обслуживание оборудования.
В России дообучение применяется при разработке отечественных языковых моделей, включая системы обработки русского языка, задачи документооборота и государственных информационных систем.
¶Ограничения
Дообучение имеет ряд ограничений:
- Катастрофическое забывание — при обучении на узком наборе данных модель может утрачивать общие способности, приобретённые на предварительном этапе.
- Переобучение — на малых выборках модель запоминает шум вместо закономерностей.
- Качество и смещения данных — ошибки и перекосы в целевом наборе данных переносятся в модель.
- Стоимость — даже адаптивные методы требуют вычислительных ресурсов и инженерной экспертизы.
Для борьбы с катастрофическим забыванием применяют методы регуляризации, смешивание общих и специализированных данных, а также техники вроде Elastic Weight Consolidation.
¶История
Понятие дообучения оформилось в 2010-х годах в контексте transfer learning. Ключевым событием стал выпуск модели BERT (Google, 2018), показавшей эффективность предварительного обучения и последующего дообучения для широкого круга языковых задач. В 2019–2020 годах дообучение GPT-подобных моделей стало стандартной практикой при создании специализированных ассистентов. Появление LoRA в 2021 году и QLoRA в 2023 году сделало дообучение доступным для исследователей с ограниченными ресурсами.
¶Источники
- Devlin J. et al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, 2018.
- Hu E. J. et al. LoRA: Low-Rank Adaptation of Large Language Models, 2021.
- Dettmers T. et al. QLoRA: Efficient Finetuning of Quantized LLMs, 2023.
- Goodfellow I., Bengio Y., Courville A. Deep Learning, MIT Press, 2016.
