Лама — проект искусственного интеллекта¶
Лама (англ. LLaMA, Large Language Model Meta AI) — семейство больших языковых моделей, разработанных исследовательским подразделением компании Meta (организация признана экстремистской и запрещена в РФ). Модели относятся к классу генеративных трансформеров и предназначены для обработки и порождения естественного языка. Первая версия была представлена в феврале 2023 года и распространялась среди академических исследователей; последующие версии стали доступны широкой публике и легли в основу множества открытых проектов.
¶История
Разработка велась командой Meta (организация признана экстремистской, деятельность запрещена в РФ) AI под руководством Яна Лекуна и Гийома Ламля. Первая модель LLaMA была анонсирована в феврале 2023 года в нескольких размерах — от 7 до 65 миллиардов параметров. Доступ к весам предоставлялся по индивидуальным запросам исследовательских организаций. Вскоре после этого веса попали в открытый доступ, что вызвало широкий резонанс и ускорило развитие открытых языковых моделей.
В июле 2023 года вышла LLaMA 2, обученная на большем объёме данных и доступная для коммерческого использования при соблюдении лицензии. В 2024 году появилась LLaMA 3, а затем её обновлённые версии с увеличенным контекстом и улучшенными мультиязычными возможностями. Каждая итерация увеличивала число параметров и качество ответов.
¶Архитектура и характеристики
Модели построены на архитектуре трансформера с механизмом самовнимания. Ключевые особенности:
- Размеры. Выпускались варианты на 7, 13, 33, 65 и 70 миллиардов параметров, а также компактные версии для мобильных устройств.
- Обучение. Использовались триллионы токенов из открытых текстовых источников, включая книги, статьи и веб-страницы.
- Токенизация. Применяется метод разбиения текста на подслова, что позволяет работать с редкими словами и разными языками.
- Дообучение. Для диалоговых версий применялось обучение с подкреплением на основе обратной связи от людей.
Модели поддерживают генерацию текста, ответы на вопросы, перевод, summarization и написание кода.
¶Применение
Благодаря открытой лицензии LLaMA стала базой для множества производных проектов. На её основе создаются чат-боты, ассистенты, инструменты для программистов и системы анализа документов. Исследователи используют модель для экспериментов в области обработки естественного языка, а компании — для внутренних задач, не требующих передачи данных внешним сервисам.
Открытость весов позволила запускать модели локально, что важно для организаций, работающих с конфиденциальной информацией. Существуют оптимизированные версии, работающие на потребительских видеокартах и даже на смартфонах.
¶Значение и критика
Появление LLaMA изменило рынок языковых моделей: она продемонстрировала, что открытые решения могут конкурировать с закрытыми коммерческими системами. Это стимулировало развитие сообщества разработчиков и появление альтернатив.
Вместе с тем модель критикуют за возможные ошибки, генерацию недостоверных сведений и предвзятость, унаследованную из обучающих данных. Отмечались случаи использования технологии для создания вредоносного контента. Лицензия также вызывала споры: она не является полностью свободной и накладывает ограничения на крупных пользователей.
¶Связанные проекты
На базе LLaMA возникли такие модели, как Alpaca, Vicuna и другие. Они дообучались на диалоговых данных и стали популярны среди энтузиастов. Российские разработчики также экспериментировали с открытыми моделями, адаптируя их под русский язык.
Источники: публикации Meta AI, научные статьи о трансформерах, обзоры открытых языковых моделей.