LMArena: платформа для тестирования ИИ¶
LMArena (ранее — LMSYS Chatbot Arena) — веб-платформа для сравнительного тестирования и ранжирования больших языковых моделей (LLM), основанная на краудсорсинговом сборе предпочтений пользователей. Проект был запущен в мае 2023 года исследовательской организацией LMSYS Org (Large Model Systems Organization) при участии Калифорнийского университета в Беркли, Калифорнийского университета в Сан-Диего и Карнеги-Меллона. Платформа позволяет пользователям одновременно взаимодействовать с двумя анонимными моделями, голосовать за лучший ответ и формировать публичный рейтинг моделей на основе парных сравнений.
¶История и развитие
Проект возник как ответ на потребность в объективной оценке быстро растущего числа открытых и проприетарных языковых моделей. Традиционные бенчмарки (например, MMLU или HellaSwag) измеряют знания по фиксированным тестам, но плохо отражают реальные предпочтения пользователей в свободном диалоге. Исследователи из LMSYS предложили использовать метод парных сравнений (tournament-style Elo rating), заимствованный из шахмат.
Первоначально платформа называлась Chatbot Arena и была доступна по адресу chat.lmsys.org. В 2024 году проект был переименован в LMArena, а домен изменён на lmarena.ai. Переименование было связано с расширением функциональности: помимо чат-ботов, платформа начала поддерживать мультимодальные модели (работа с изображениями) и модели для генерации кода.
К 2025 году в рейтинге LMArena было представлено более 200 моделей, а количество зарегистрированных голосов превысило несколько миллионов. Платформа стала одним из наиболее цитируемых независимых источников сравнения LLM в индустрии.
¶Механика работы
¶Голосование
Основной режим работы — «Арена». Пользователь вводит произвольный запрос (промпт) в текстовое поле. Система случайным образом выбирает две модели из пула и отправляет запрос обеим, не раскрывая их названия. После получения ответов пользователь оценивает, какой из них лучше, по критериям полезности, релевантности и безопасности. Доступны варианты: «Модель A лучше», «Модель B лучше», «Ничья» или «Оба плохие».
¶Рейтинговая система
На основе голосов модели получают рейтинг по системе Эло (Elo rating). Изначально все модели стартуют со значением 1000 баллов. После каждого голосования рейтинг победившей модели повышается, а проигравшей — понижается, с учётом ожидаемой вероятности победы (сильная модель получает меньше очков за победу над слабой). Дополнительно используется система Брэдли—Терри для оценки вероятности предпочтения одной модели другой.
Помимо общего рейтинга, существуют отдельные категории: «Текстовые модели», «Мультимодальные модели», «Модели для программирования», а также фильтры по длине ответа, стилю и языку. Рейтинг обновляется ежедневно и публикуется на главной странице в виде таблицы с разбивкой по категориям.
¶Режимы тестирования
LMArena предоставляет несколько режимов:
- Arena (Battle) — классическое парное сравнение.
- Side-by-side — сравнение ответов двух моделей без обязательного выбора победителя.
- Single model — тестирование одной модели без сравнения.
- Blind mode — режим, в котором пользователь не знает, что отвечает модели, до окончания голосования.
¶Технические особенности
¶API и интеграция
LMArena предоставляет открытый API, позволяющий разработчикам автоматизировать процесс тестирования собственных моделей. Также доступен набор данных (dataset) с анонимизированными диалогами и голосами пользователей, который используется исследовательским сообществом для обучения моделей вознаграждения (reward models) и анализа предпочтений.
¶Широкий охват моделей
На платформе представлены как проприетарные коммерческие модели (GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro), так и открытые веса моделей (Llama 3.1, Mistral, Qwen, DeepSeek). Это позволяет сравнивать решения разных разработчиков в единой среде.
¶Критика и ограничения
Несмотря на популярность, методология LMArena подвергается критике со стороны части исследовательского сообщества.
¶Смещение выборки
Пользователи, голосующие на платформе, не являются репрезентативной выборкой. Это, как правило, технически подкованные энтузиасты ИИ, интересующиеся новейшими моделями. Их предпочтения могут отличаться от предпочтений массового пользователя. Кроме того, голосующие могут иметь предвзятость к брендам (например, ожидать высокого качества от известных моделей), что влияет на объективность.
¶Стилистические предпочтения
Исследования показывают, что пользователи часто предпочитают более «разговорчивые» и подробные ответы, даже если они содержат избыточную информацию. Это приводит к тому, что модели, настроенные на краткость, могут занижаться в рейтинге, несмотря на фактическую точность.
¶Игровые стратегии
Разработчики моделей могут оптимизировать свои системы под предпочтения аудитории LMArena (например, добавляя определённые стилистические маркеры или шаблонные фразы), что искажает реальную полезность модели в специализированных задачах.
¶Конфиденциальность
Хотя платформа заявляет об анонимизации диалогов, пользователи должны осознавать, что их запросы могут быть использованы в исследовательских целях и опубликованы в открытых датасетах.
¶Влияние на индустрию
LMArena стала де-факто стандартом для «человеческой» оценки LLM. Многие компании, включая OpenAI, Anthropic, Google и Meta (организация признана экстремистской, деятельность запрещена в РФ), отслеживают позиции своих моделей в рейтинге и используют результаты для внутренней разработки. Платформа также используется академическими исследователями для валидации новых методов обучения с подкреплением на основе обратной связи от людей (RLHF). Публикация «живого» рейтинга каждую неделю создаёт соревновательную динамику на рынке ИИ, стимулируя быстрый выпуск улучшенных версий моделей.
¶Альтернативные платформы
Помимо LMArena, существуют аналогичные проекты. Например, Artificial Analysis проводит стандартизированные тесты производительности и качества. Open LLM Leaderboard от Hugging Face оценивает модели по автоматическим бенчмаркам. Однако LMArena остаётся уникальной благодаря масштабу реальных пользовательских голосов и открытости методологии.
¶Источники
- Официальный сайт LMArena (lmarena.ai)
- Публикация «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena» (LMSYS, 2023)
- Документация LMSYS Org по рейтинговой системе Эло
- Статистические отчёты проекта Artificial Analysis
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
