Qwen — семейство нейросетевых моделей¶
Qwen — семейство больших языковых моделей (LLM) и мультимодальных нейросетей, разрабатываемых китайской компанией Alibaba Group через подразделение Alibaba Cloud (под брендом Tongyi Qianwen). Модели предназначены для генерации текста, ответов на вопросы, программирования, анализа данных и обработки изображений, распространяются как в проприетарном виде через облачные API, так и в открытом виде с открытым исходным кодом.
¶История
Первая версия модели Qwen (сокращение от «Tongyi Qianwen» — «Вопросы и ответы тысячи вопросов») была анонсирована Alibaba Cloud в апреле 2023 года. Изначально система позиционировалась как аналог ChatGPT для китайского рынка, интегрированный в экосистему Alibaba (мессенджер DingTalk, офисный пакет и облачные сервисы).
В августе 2023 года компания открыла исходный код первой открытой модели семейства — Qwen-7B, что сделало её доступной для локального развёртывания. В последующие месяцы вышли версии 14B и 72B, а также мультимодальная модель Qwen-VL, способная обрабатывать изображения.
В 2024 году Alibaba выпустила второе поколение — Qwen1.5 и Qwen2 с улучшенной архитектурой, увеличенным контекстным окном (до 128 тысяч токенов) и поддержкой множества языков, включая русский. В конце 2024 года были представлены модели Qwen2.5 с расширенной версией Qwen2.5-Max, которая, по заявлениям компании, сопоставима по производительности с передовыми западными моделями. В 2025 году вышло поколение Qwen3, включающее как плотные, так и разреженные (MoE) архитектуры, а также версии с поддержкой «мышления» (reasoning).
¶Архитектура и технические характеристики
Все модели Qwen основаны на архитектуре трансформера. Ключевые технические особенности:
- Механизм внимания: используется улучшенное групповое внимание (GQA), снижающее требования к памяти.
- Контекстное окно: от 32 до 256 тысяч токенов в зависимости от версии, что позволяет обрабатывать длинные документы и диалоги.
- Токенизация: поддерживается многозыковая токенизация, включая китайский, английский, русский, испанский, французский, немецкий и другие языки.
- Инструктивная настройка: модели дообучаются на данных с инструкциями (instruction tuning) и с использованием обратной связи от людей (RLHF), что повышает качество следования командам.
- Режимы работы: в поколении Qwen3 появился гибридный режим — модель может работать как в обычном (быстром) режиме, так и в режиме рассуждений («мышления»), когда она генерирует внутреннюю цепочку размышлений перед ответом.
Размеры моделей варьируются от компактных версий с 0,5 млрд параметров до крупных с 235 млрд параметров (Qwen2.5-Max). Открытые версии выпускаются под лицензией Apache 2.0, что разрешает коммерческое использование и модификацию.
¶Виды моделей
Семейство Qwen включает несколько специализированных линеек:
- Qwen (базовые языковые модели) — текстовые модели для генерации, анализа и диалога.
- Qwen-VL — мультимодальные модели, способные распознавать и анализировать изображения, отвечать на вопросы по картинкам, распознавать текст на фото.
- Qwen2-Audio — модели для обработки аудио, распознавания речи и звуковых событий.
- Qwen-Code — специализированные модели для программирования, оптимизированные на кодовых корпусах.
- QwQ — экспериментальная линейка моделей с усиленными способностями к логическим рассуждениям (аналог OpenAI o1).
- Qwen-Math — модели, ориентированные на решение математических задач.
¶Применение
Модели Qwen используются в нескольких ключевых сферах:
- Облачные сервисы: через платформу Alibaba Cloud Model Studio компании могут арендовать доступ к API для интеграции в свои продукты.
- Локальное развёртывание: открытые версии позволяют организациям запускать модели на собственном оборудовании, что важно для задач с требованиями конфиденциальности данных.
- Разработка программного обеспечения: модели применяются для автодополнения кода, генерации функций, написания тестов и документации.
- Бизнес-приложения: чат-боты, обработка документов, анализ отзывов, автоматизация поддержки клиентов.
- Научные исследования: применение в биоинформатике, химии и других областях для анализа научной литературы и генерации гипотез.
В России модели Qwen получили распространение благодаря открытому коду и поддержке русского языка. Они используются в академических проектах, стартапах и для создания локальных ассистентов, работающих без подключения к зарубежным облачным сервисам.
¶Сравнение с другими моделями
По результатам бенчмарков (MMLU, HumanEval, GSM8K и других), модели Qwen демонстрируют результаты на уровне или выше таких систем, как Llama от Meta (организация признана экстремистской и запрещена в РФ), Mistral и GPT-3.5, уступая при этом наиболее мощным проприетарным моделям (GPT-4, Claude) в сложных рассуждениях и креативных задачах. Ключевыми преимуществами Qwen считаются:
- открытый исходный код и бесплатное использование;
- хорошая поддержка китайского и русского языков;
- большое контекстное окно;
- наличие версий разного размера под различные аппаратные возможности.
Среди недостатков отмечают меньшую эффективность на английском языке по сравнению с лучшими западными аналогами, а также потенциальные ограничения, связанные с цензурой контента, обусловленной требованиями законодательства КНР.
¶Интересные факты
- Название «Tongyi Qianwen» переводится с китайского как «Тысяча вопросов от единой воли».
- В 2024 году Alibaba заявляла, что суммарное число вызовов API Qwen превысило 100 миллиардов.
- Открытые модели Qwen стали основой для множества дообученных специализированных моделей, выпущенных независимыми разработчиками.
- Модель Qwen2.5-72B входит в число самых скачиваемых открытых моделей на платформе Hugging Face.
- В 2025 году Alibaba выпустила Qwen3-235B-A22B — разреженную модель с 235 млрд параметров, из которых при каждом запросе активируются только 22 млрд, что снижает вычислительные затраты.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →

