МоделиОткрытый код 🇨🇳 21.07.2026 01:04

Qwen2.5: вечеринка фундаментальных моделей!

Alibaba/QwenAlibaba/Qwen
Компания Alibaba Qwen представила серию открытых моделей Qwen2.5, включая языковые модели, специализированные модели для кодирования (Qwen2.5-Coder) и математики (Qwen2.5-Math). Модели доступны в размерах от 0,5 до 72 миллиардов параметров, обучены на 18 триллионах токенов и демонстрируют улучшенные показатели по сравнению с предшественниками. Все модели, кроме 3B и 72B, распространяются под лицензией Apache 2.0.
Команда Alibaba Qwen объявила о выпуске Qwen2.5 — нового семейства фундаментальных моделей, которое включает в себя языковые модели общего назначения (Qwen2.5), модели для кодирования (Qwen2.5-Coder) и модели для математики (Qwen2.5-Math). Все модели имеют открытые веса и являются плотными декодерными языковыми моделями. Доступны следующие размеры: Qwen2.5 — 0,5B, 1.5B, 3B, 7B, 14B, 32B и 72B параметров; Qwen2.5-Coder — 1.5B, 7B и 32B (32B готовится к выходу); Qwen2.5-Math — 1.5B, 7B и 72B. Все открытые модели, кроме версий 3B и 72B, распространяются под лицензией Apache 2.0. Qwen2.5 предобучен на новом крупномасштабном наборе данных объёмом до 18 триллионов токенов, что позволило значительно улучшить знания (MMLU 85+), навыки кодирования (HumanEval 85+) и математические способности (MATH 80+). Модели также поддерживают контекст до 128 тысяч токенов и генерацию до 8 тысяч токенов, работают с более чем 29 языками. Qwen2.5-72B, крупнейшая открытая модель семейства, сравнивается с лидерами, такими как Llama-3.1-70B и Mistral-Large-V2, а её базовая версия соперничает даже с Llama-3-405B. API-модель Qwen-Plus значительно превосходит DeepSeek-V2.5 и конкурирует с Llama-3.1-405B, уступая GPT-4o и Claude-3.5-Sonnet по некоторым аспектам. Модели 14B и 32B вновь представлены и превосходят по производительности Phi-3.5-MoE-Instruct и Gemma2-27B-IT. Qwen2.5-3B достигает впечатляющих результатов при небольшом размере. Qwen2.5-Coder-7B-Instruct, несмотря на меньший размер, превосходит многие крупные модели в задачах кодирования. Qwen2.5-Math-72B-Instruct превосходит GPT-4o, а даже версия 1.5B показывает высокую конкурентоспособность. Модели доступны для использования через Hugging Face Transformers, vLLM, Ollama и другие фреймворки. Авторы благодарят сообщество за поддержку и отмечают, что следующей целью является объединение языковых, визуальных и аудиомодальностей в единую модель.
Сокращения
API = Application Programming Interface — интерфейс программирования приложений
JSON = JavaScript Object Notation — нотация объектов JavaScript
CoT = Chain-of-Thought — цепочка рассуждений
PoT = Program-of-Thought — программа рассуждений
TIR = Tool-Integrated Reasoning — рассуждение с интеграцией инструментов
Источник: Alibaba Qwen — оригинал

Наши прошлые публикации по теме

Есть свежие новости