MMLU¶
MMLU (Massive Multitask Language Understanding) — это бенчмарк (набор тестовых заданий) для оценки качества больших языковых моделей (LLM), предназначенный для измерения их способности решать задачи из различных областей знаний на уровне, сопоставимом с человеческим. Разработанный в 2020 году, MMLU стал одним из наиболее широко используемых стандартов для сравнения производительности языковых моделей, включая GPT, LLaMA, YandexGPT и другие.
¶История и разработка
Бенчмарк MMLU был представлен в 2020 году группой исследователей из Калифорнийского университета в Беркли, Колумбийского университета, Чикагского университета и компании Salesforce. Основной целью разработчиков было создание комплексного теста, который бы оценивал не просто способность модели генерировать текст, а её понимание и применение знаний в разнообразных дисциплинах. В отличие от более ранних бенчмарков, таких как GLUE или SuperGLUE, которые фокусировались на узких задачах обработки естественного языка (например, анализ тональности или ответы на вопросы по коротким текстам), MMLU охватывает широкий спектр академических и профессиональных предметов.
Первая версия MMLU включала 57 тем, разделённых на 14 категорий, таких как гуманитарные науки, социальные науки, точные науки и другие. В 2021 году была выпущена расширенная версия — MMLU-Pro, которая добавила более сложные вопросы и увеличила количество тем до 65. В 2023 году, с ростом интереса к LLM, MMLU стал ключевым инструментом для сравнения моделей, таких как GPT-4, Gemini, Claude и других.
¶Структура и содержание
MMLU состоит из более чем 14 000 вопросов с множественным выбором (обычно четыре варианта ответа). Вопросы охватывают 57 предметных областей, включая:
- Гуманитарные науки: история, философия, право, этика.
- Социальные науки: экономика, психология, политология, социология.
- Точные и естественные науки: математика, физика, химия, биология, медицина.
- Профессиональные области: бухгалтерский учёт, юриспруденция, клинические знания, менеджмент.
Каждый вопрос имеет один правильный ответ, определённый экспертами в соответствующей области. Вопросы формулируются на английском языке, но могут быть переведены на другие языки для тестирования мультиязычных моделей. Уровень сложности варьируется от базовых школьных знаний до университетского курса и профессиональных экзаменов (например, USMLE — медицинский лицензионный экзамен в США).
¶Методология оценки
Оценка модели на MMLU проводится в рамках парадигмы «zero-shot» (без примеров) или «few-shot» (с несколькими примерами). В режиме few-shot модели предоставляется от 3 до 5 примеров вопросов и ответов из той же предметной области, после чего она должна ответить на тестовые вопросы. Результат выражается в процентах правильных ответов (accuracy). Для сравнения с человеческим уровнем часто используется порог в 89,8% — средний результат, показанный экспертами-людьми при прохождении теста.
Важной особенностью MMLU является то, что он не требует от модели генерации длинных текстов — достаточно выбрать правильный вариант из предложенных. Это снижает влияние таких факторов, как стиль письма или длина ответа, и фокусируется на глубине знаний.
¶Значение и применение
MMLU стал стандартом де-факто для оценки языковых моделей по нескольким причинам:
- Широта охвата: тест проверяет знания в десятках дисциплин, что даёт комплексную картину способностей модели.
- Объективность: вопросы имеют однозначные ответы, что исключает субъективность при оценке.
- Сравнимость: результаты MMLU публикуются для большинства крупных моделей, что позволяет легко сравнивать их.
Бенчмарк используется как исследователями, так и разработчиками для:
- Сравнения производительности различных моделей (например, GPT-4 показал результат около 86,4%, а Claude 3 — около 86,8%).
- Выявления слабых мест модели (например, низкие результаты в математике или юриспруденции).
- Тестирования улучшений в процессе обучения модели.
¶Критика и ограничения
Несмотря на широкое распространение, MMLU имеет ряд критических замечаний:
- Узкий формат: вопросы с множественным выбором не отражают реальные задачи, где требуется генерация текста или рассуждения.
- Запоминание: модель может «запоминать» ответы из обучающих данных, а не демонстрировать понимание. Исследования показали, что некоторые модели показывают высокие результаты на MMLU, но проваливаются на более сложных задачах, требующих логического вывода.
- Англоцентричность: большинство вопросов основаны на западной академической традиции, что может давать преимущество моделям, обученным на англоязычных данных.
- Устаревание: с появлением более мощных моделей MMLU перестаёт быть достаточным для различения их возможностей — многие модели достигают результатов, близких к человеческим (выше 85-90%).
В ответ на эти ограничения были разработаны более сложные бенчмарки, такие как MMLU-Pro (с более сложными вопросами), BIG-bench (с задачами на рассуждение) и HumanEval (для оценки кода).
¶Примеры вопросов
Для иллюстрации приведём несколько примеров вопросов из MMLU:
- Тема: Физика
Вопрос: Какая из следующих величин является скалярной? Варианты: A) Сила, B) Скорость, C) Энергия, D) Ускорение Правильный ответ: C) Энергия
- Тема: История
Вопрос: В каком году началась Первая мировая война? Варианты: A) 1912, B) 1914, C) 1916, D) 1918 Правильный ответ: B) 1914
- Тема: Медицина
Вопрос: Какой витамин синтезируется в коже под воздействием солнечного света? Варианты: A) Витамин A, B) Витамин C, C) Витамин D, D) Витамин E Правильный ответ: C) Витамин D
¶Влияние на развитие ИИ
MMLU сыграл важную роль в популяризации бенчмарков для оценки языковых моделей. Его результаты часто цитируются в научных статьях, пресс-релизах компаний (например, OpenAI, Google, Anthropic) и в обсуждениях прогресса в области искусственного интеллекта. В 2023 году MMLU был включён в состав тестов для оценки моделей в рамках проекта «Stanford CRFM» (Центр исследований фундаментальных моделей). В России MMLU используется для тестирования моделей, таких как YandexGPT и GigaChat, что позволяет сравнивать их с международными аналогами.
¶Источники
- Hendrycks, D., Burns, C., Basart, S., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv:2009.03300.
- Hendrycks, D., et al. (2021). «MMLU-Pro: A More Robust and Challenging Benchmark for Language Understanding». arXiv:2106.09247.
- Официальная страница MMLU на GitHub: github.com/hendrycks/test
- Статья «GPT-4 Technical Report» (OpenAI, 2023).
- Статья «Claude 3 Model Card» (Anthropic, 2024).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


