LMArena: платформа рейтинга языковых моделей¶
LMArena (ранее — Chatbot Arena) — это веб-платформа для сравнительного тестирования и рейтингования больших языковых моделей (LLM) на основе краудсорсинговых голосований пользователей. Проект был запущен в мае 2023 года исследовательской организацией LMSYS (Large Model Systems Organization), созданной при участии Калифорнийского университета в Беркли, Калифорнийского университета в Сан-Диего и Университета Карнеги — Меллона. Платформа позволяет пользователям одновременно взаимодействовать с двумя анонимными моделями, оценивать качество их ответов и формировать публичный рейтинг моделей в формате «эло».
¶Принцип работы
Основная механика LMArena построена на методе попарного сравнения. Пользователь вводит произвольный запрос в чат-интерфейсе, после чего система отправляет его двум случайно выбранным моделям, не раскрывая их названия. После получения ответов пользователь голосует за лучший вариант, либо объявляет ничью. Идентичность моделей раскрывается только после завершения голосования, что снижает влияние брендовых предубеждений на оценку.
Голосования агрегируются в общий рейтинг, рассчитываемый по системе Эло — алгоритму, изначально разработанному для шахматных турниров. Каждая пара моделей сравнивается многократно, а разница в рейтинговых очках обновляется в зависимости от результата каждого матча. На основе накопленной статистики платформа строит несколько таблиц лидеров: общий зачёт, отдельные категории (например, модели с открытым и закрытым исходным кодом), а также специализированные рейтинги по типам задач — программирование, математика, рассуждения, обработка длинных контекстов и другие.
¶История и развитие
В августе 2023 года платформа была переименована из Chatbot Arena в LMArena. Первоначально проект поддерживал лишь несколько моделей, включая GPT-3.5, Claude и Vicuna. По мере развития индустрии число участников постоянно росло: уже в 2024 году на платформе тестировались десятки моделей от OpenAI, Google, Anthropic, Meta (организация признана экстремистской, деятельность запрещена в РФ), Alibaba, Mistral AI и других компаний.
Важной вехой стало внедрение «анонимного режима» для разработчиков: создатели моделей получили возможность отправлять свои системы на тестирование под псевдонимом, чтобы получить объективную оценку до публичного релиза. В 2024 году LMArena также запустила собственный бенчмарк с закрытыми тестовыми вопросами для автоматической оценки моделей, дополняющий краудсорсинговые голосования.
¶Влияние на индустрию
LMArena стала де-факто отраслевым стандартом для неофициального сравнения качества чат-моделей. Рейтинги платформы регулярно цитируются в научных публикациях, технических отчётах компаний-разработчиков и прессе. Высокая позиция в таблице лидеров LMArena рассматривается многими разработчиками как значимый маркетинговый результат, сопоставимый с успешным прохождением формализованных бенчмарков вроде MMLU или HumanEval.
Популярность платформы объясняется несколькими факторами. Во-первых, она использует реальные пользовательские запросы, что позволяет оценивать модели на задачах, приближенных к практическому применению, а не на синтетических тестах. Во-вторых, попарное сравнение признаётся более надёжным методом, чем абсолютные оценки по шкале, поскольку людям проще выбрать лучший вариант из двух, чем выставить объективную оценку. В-третьих, анонимность моделей снижает эффект ожиданий, связанных с репутацией разработчика.
¶Критика и ограничения
Несмотря на авторитет, методология LMArena подвергается критике. Основные претензии касаются субъективности пользовательских оценок: большинство голосующих не являются экспертами и могут предпочитать более «красивые» или развёрнутые ответы, а не фактически точные. Кроме того, выборка запросов нерепрезентативна — она отражает интересы технически грамотной аудитории, преимущественно англоговорящей, что создаёт перекос в сторону определённых типов задач.
Отмечается также уязвимость рейтинга к накрутке: разработчики моделей теоретически могут организовать массовое голосование за свою систему. Хотя LMSYS принимает меры против накрутки, включая фильтрацию по IP-адресам и паттернам поведения, полностью исключить манипуляции невозможно. Дополнительную сложность создаёт быстрое обновление моделей: версии обновляются, устаревают, и рейтинг не всегда успевает отражать актуальное состояние индустрии.
¶Текущее состояние
По состоянию на 2025 год LMArena продолжает оставаться одной из наиболее посещаемых площадок для тестирования ИИ-ассистентов. Платформа расширила функционал, добавив поддержку мультимодальных моделей (способных обрабатывать изображения), а также режимы для оценки голосовых интерфейсов. Накопленный массив данных о предпочтениях пользователей используется исследователями для анализа поведения моделей и разработки новых методов их оценки.
Помимо основного сайта, LMSYS публикует открытые наборы данных с обезличенными результатами голосований, что позволяет научному сообществу воспроизводить и проверять выводы платформы. Проект также проводит собственные исследования в области автоматической оценки качества ответов, стремясь снизить зависимость от дорогостоящего ручного труда асессоров.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
