Открыть сервис

Qwen — семейство больших языковых моделей

Qwen (от англ. «Question» и «Web» — «вопрос» и «сеть») — семейство больших языковых моделей (LLM) и мультимодальных нейросетей, разрабатываемых китайской компанией Alibaba Group. Модели предназначены для генерации текста, ответов на вопросы, написания кода, анализа данных и решения широкого круга задач обработки естественного языка. Первая версия была представлена в августе 2023 года, после чего семейство быстро расширилось, став одним из самых заметных открытых проектов в области искусственного интеллекта наряду с моделями LLaMA (Meta — организация признана экстремистской и запрещена в РФ) и Mistral.

История

Разработка Qwen ведётся подразделением Alibaba Cloud (облачное подразделение Alibaba Group) и исследовательским институтом DAMO Academy. Первые модели Qwen-7B (с 7 миллиардами параметров) и Qwen-14B были выпущены в августе 2023 года. Они распространялись с открытыми весами под лицензией Apache 2.0, что позволяло исследователям и компаниям свободно использовать их в коммерческих проектах.

В сентябре 2023 года вышла мультимодальная версия Qwen-VL, способная обрабатывать изображения и отвечать на вопросы по их содержанию. В октябре того же года появился чат-интерфейс Tongyi Qianwen (通义千问), доступный китайским пользователям через веб-портал и мобильное приложение.

Ключевым этапом стало появление в феврале 2024 года модели Qwen1.5 — промежуточной версии с улучшенной архитектурой и поддержкой нескольких языков. В апреле 2024 года Alibaba выпустила Qwen2, которая включала модели с размером от 0,5 до 72 миллиардов параметров, а также специализированные версии для кодирования (Qwen2-Coder) и математики (Qwen2-Math). В сентябре 2024 года была представлена Qwen2.5 с расширенной базой знаний и улучшенной способностью следовать инструкциям.

В январе 2025 года вышла Qwen2.5-Max, позиционировавшаяся как флагманская модель для конкуренции с GPT-4o и Claude 3.5. В сентябре 2025 года Alibaba анонсировала Qwen3 — новое поколение с гибридной архитектурой, включающей как плотные, так и разреженные (MoE) варианты. К концу 2025 года суммарное число загрузок моделей семейства Qwen превысило 40 миллионов, что сделало его одним из самых популярных открытых семейств LLM в мире.

Архитектура и технические характеристики

Модели Qwen основаны на архитектуре трансформера с механизмом самовнимания. Ключевые технические особенности:

  • Длина контекста — от 32 768 до 131 072 токенов в зависимости от версии, что позволяет обрабатывать большие документы и длинные диалоги.
  • Размер параметров — варьируется от 0,5 млрд (компактные версии для мобильных устройств) до 235 млрд (Qwen2.5-Max) и 685 млрд (Qwen3-Max, разреженная архитектура с активацией 29 млрд параметров на токен).
  • Токенизацияподдержка китайского, английского и ещё более 20 языков, включая русский, японский, корейский, французский, немецкий и испанский.
  • Квантование — модели доступны в версиях с 4-битным и 8-битным квантованием (GGUF, AWQ), что позволяет запускать их на потребительских видеокартах.
  • Мультимодальность — версии Qwen-VL принимают на вход изображения, а Qwen-Audio — аудиозаписи.

Модели обучаются на смеси текстовых данных из открытых источников, включая веб-страницы, книги, научные статьи и код из публичных репозиториев. Точный состав обучающих данных не раскрывается, однако Alibaba заявляет о фильтрации вредоносного и дублирующегося контента.

Версии и классификация

Семейство Qwen включает несколько линеек, различающихся по назначению:

  • Qwen (базовые) — универсальные модели для генерации текста и диалога.
  • Qwen-Coder — специализированные модели для программирования, обученные на больших объёмах кода.
  • Qwen-Math — модели для решения математических задач и логических рассуждений.
  • Qwen-VL — мультимодальные модели для работы с изображениями и видео.
  • Qwen-Audio — модели для обработки речи и звука.
  • QwQ — экспериментальная линейка с акцентом на длинные цепочки рассуждений.

По размеру параметров модели делятся на компактные (0,5–4 млрд), средние (7–32 млрд) и крупные (72 млрд и более). Крупные версии, как правило, демонстрируют более высокое качество ответов, но требуют значительных вычислительных ресурсов.

Применение

Благодаря открытой лицензии модели Qwen используются в трёх основных направлениях:

  1. Коммерческие продукты — компании интегрируют Qwen в чат-боты, системы поддержки клиентов, поисковые сервисы и ассистентов. Alibaba использует собственные модели в маркетплейсах Taobao и Tmall для автоматического описания товаров и рекомендаций.
  1. Научные исследования — Qwen применяется в академических проектах для анализа текстов, обработки медицинских данных, автоматизации лабораторных экспериментов и обучения студентов. Открытые веса позволяют дообучать модели на специализированных наборах данных.
  1. Разработка ПО — модели Qwen-Coder используются программистами для автодополнения кода, генерации тестов, рефакторинга и поиска ошибок. Интеграция средами разработки (IDE) осуществляется через плагины и API.

В России модели Qwen доступны через открытые репозитории (Hugging Face) и могут запускаться локально без обращения к облачным серверам Alibaba. Это делает их привлекательными для организаций с требованиями к конфиденциальности данных.

Сравнение с аналогами

По результатам бенчмарков (MMLU, HumanEval, GSM8K) модели Qwen3 сопоставимы по качеству с открытыми моделями LLaMA 3.1 и Mistral Large, а в ряде задач превосходят их. В тестах на китайском языке Qwen традиционно показывает результаты выше, чем западные аналоги, что связано с более качественными данными для обучения. Среди закрытых моделей ближайшими конкурентами Qwen являются GPT-4o (OpenAI), Claude 3.5 (Anthropic) и Gemini (Google), однако открытая лицензия и возможность локального развёртывания дают Qwen преимущество в сценариях, где требуется контроль над данными.

Критика и ограничения

Как и другие большие языковые модели, Qwen подвержена «галлюцинациям» — генерации правдоподобных, но фактически неверных утверждений. Модель может воспроизводить предвзятости, присутствующие в обучающих данных, а также демонстрировать ограниченную способность к рассуждениям в сложных логических задачах. Критики также отмечают, что модели Qwen, обученные в Китае, могут отражать позицию властей КНР по чувствительным политическим вопросам, что ограничивает их нейтральность в таких темах.

Технические ограничения включают высокие требования к памяти для крупных версий (модель на 72 млрд параметров требует около 140 ГБ видеопамяти без квантования) и относительно высокую задержку ответа на слабом оборудовании. Кроме того, документация и часть инструментов изначально ориентированы на китайский язык, что создаёт барьер для части западных разработчиков.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →