LLM Arena: платформа сравнения языковых моделей¶
LLM Arena (также известная как LMArena) — это веб-платформа для краудсорсингового сравнительного анализа больших языковых моделей (LLM), разработанная исследовательской лабораторией LMSYS (Large Model Systems Organization). Сервис позволяет пользователям голосовать за ответы двух анонимных чат-ботов, на основе чего формируется публичный рейтинг моделей по системе Эло. Платформа запущена в мае 2023 года и стала одним из наиболее цитируемых бенчмарков в области оценки генеративных нейросетей.
¶История и предпосылки создания
LMSYS была основана исследователями из Калифорнийского университета в Беркли, Калифорнийского университета в Сан-Диего и Карнеги-Меллона. Основной проблемой, которую стремились решить создатели, была ограниченность традиционных статических бенчмарков (например, MMLU или HumanEval). Такие тесты быстро устаревают из-за утечек данных в обучающие выборки новых моделей, а также не отражают реальные предпочтения пользователей в свободном диалоге.
LLM Arena была запущена в мае 2023 года как развитие проекта Chatbot Arena. Изначально платформа сравнивала всего несколько открытых моделей, включая ранние версии LLaMA и Vicuna. По мере роста популярности число участников расширилось до десятков проприетарных и открытых систем, включая GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro, DeepSeek-R1 и отечественные разработки, такие как YandexGPT 3 Pro.
¶Механизм работы
¶Процесс голосования
Пользователь заходит на сайт, вводит произвольный запрос в текстовое поле и получает ответы от двух случайно выбранных моделей, обозначенных как «Модель A» и «Модель B». Идентичность моделей скрыта до момента голосования. Пользователь может выбрать лучший ответ, объявить ничью или указать, что оба ответа неудовлетворительны.
После голосования платформа раскрывает названия моделей и предлагает пользователю продолжить диалог с победившей моделью. Это создаёт дополнительный стимул для участия и сбора данных о длинных многоходовых беседах.
¶Рейтинг Эло
На основе парных голосований платформа рассчитывает рейтинг каждой модели по системе Эло, аналогичной используемой в шахматах. Начальное значение рейтинга составляет 1000 очков. Победа увеличивает рейтинг модели, поражение — уменьшает. Величина изменения зависит от разницы в текущих рейтингах соперников: победа над более сильной моделью приносит больше очков, чем победа над слабой.
Для повышения статистической достоверности применяется метод Брэдли—Терри, который позволяет оценивать вероятность победы одной модели над другой на основе накопленных парных сравнений. Публичная таблица лидеров обновляется ежедневно и включает не только общий рейтинг, но и отдельные категории: программирование, математика, рассуждения, обработка длинных текстов, творческие задачи и др.
¶Контроль качества
Для защиты от накруток и ботов платформа использует несколько механизмов. Во-первых, регистрация через аккаунты Google или Hugging Face. Во-вторых, анализ IP-адресов и поведенческих паттернов. В-третьих, автоматическая фильтрация подозрительных голосов статистическими методами. Несмотря на это, исследователи признают, что абсолютной защиты от манипуляций не существует, а потому рейтинг LLM Arena отражает скорее усреднённое мнение технически подкованной аудитории, чем всей популяции пользователей.
¶Значение и применение
¶Научная ценность
LLM Arena предоставляет исследовательскому сообществу уникальный набор данных: более миллиона реальных пользовательских запросов и предпочтений. Эти данные используются для обучения моделей вознаграждения (reward models) в системах RLHF (обучение с подкреплением на основе обратной связи от людей), а также для изучения корреляции между автоматическими метриками и человеческими оценками.
¶Практическое применение
Для разработчиков и компаний рейтинг LLM Arena стал де-факто стандартом при выборе базовой модели для коммерческих продуктов. Многие организации публикуют результаты тестирования своих моделей на арене как маркетинговый аргумент. Например, выход DeepSeek-R1 в январе 2025 года сопровождался активным обсуждением её позиции в рейтинге LLM Arena, где она показала результаты, сопоставимые с проприетарными моделями ведущих западных лабораторий.
¶Критика и ограничения
¶Смещения выборки
Основной недостаток LLM Arena — нерепрезентативность аудитории. Средний пользователь платформы — это разработчик или энтузиаст ИИ, который задаёт модели технические вопросы, связанные с программированием или математикой. Это приводит к тому, что модели, оптимизированные под такие задачи, получают завышенные оценки, в то время как модели, предназначенные для массового потребителя (например, с усиленной цензурой или ограничениями безопасности), оказываются в невыгодном положении.
¶Стилистические предпочтения
Исследования показывают, что пользователи склонны предпочитать более длинные, детализированные и «уверенные» ответы, даже если они содержат фактические ошибки. Это создаёт давление на разработчиков в сторону «разговорчивости» моделей в ущерб точности. Кроме того, модели, обученные с акцентом на безопасность и отказ от ответа на потенциально опасные запросы, систематически проигрывают менее ограниченным аналогам в общем рейтинге.
¶Прозрачность и воспроизводимость
Критике подвергается и непрозрачность процесса: версии моделей на арене могут отличаться от коммерчески доступных, а дата заморозки весов не всегда указывается. Это затрудняет воспроизведение результатов и сравнение с официальными заявлениями разработчиков.
¶Аналоги и альтернативы
Популярность LLM Arena породила ряд аналогичных проектов. Среди них — Artificial Analysis (сфокусирован на автоматизированных тестах и скорости инференса), Open LLM Leaderboard от Hugging Face (основан на статических бенчмарках) и российская платформа Mera Bench, разработанная при участии «Сбера» для оценки моделей на русском языке. В отличие от LLM Arena, эти платформы чаще используют автоматические метрики, а не краудсорсинг.
¶Перспективы развития
Разработчики LLM Arena анонсировали планы по внедрению автоматического судейства с использованием сильных моделей (LLM-as-a-judge) для масштабирования числа сравнений, а также расширение категорий оценки на мультимодальные задачи (анализ изображений, аудио и видео). Платформа продолжает оставаться одним из ключевых инструментов мониторинга быстро меняющегося ландшафта больших языковых моделей.
¶Источники
- Официальный сайт и документация проекта LMSYS / LMArena.
- Научные публикации лаборатории LMSYS о методологии Chatbot Arena (2023–2024).
- Материалы конференций NeurIPS и ICML, посвящённые оценке LLM.
- Публичные отчёты разработчиков моделей (OpenAI, Google, Anthropic, DeepSeek, Яндекс) о результатах тестирования на платформе.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
