МоделиИсследования 🇨🇳 20.07.2026 18:05

QwQ-32B: масштабирование обучения с подкреплением

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
Alibaba Qwen представила модель QwQ-32B с 32 миллиардами параметров, которая благодаря масштабированному обучению с подкреплением (RL) достигает производительности, сравнимой с DeepSeek-R1 (671 млрд параметров). Модель открыта под лицензией Apache 2.0 и доступна на Hugging Face, ModelScope и через Qwen Chat.
Команда Qwen из Alibaba анонсировала модель QwQ-32B с 32 миллиардами параметров, которая достигает производительности, сопоставимой с DeepSeek-R1 (671 млрд параметров, 37 млрд активированных). Это стало возможным благодаря масштабированию обучения с подкреплением (RL) на основе тщательно обученной базовой модели. В первом этапе RL применяли только для математики и программирования, используя верификатор точности и сервер выполнения кода для оценки результатов. Затем добавили второй этап RL для общих способностей, используя общую модель вознаграждения и правила. Модель также интегрирует агентные возможности, позволяя использовать инструменты и адаптировать рассуждения на основе обратной связи. QwQ-32B превосходит DeepSeek-R1-Distilled-Qwen-32B, DeepSeek-R1-Distilled-Llama-70B, o1-mini и сопоставима с оригинальным DeepSeek-R1. Модель с открытым весом доступна на Hugging Face и ModelScope под лицензией Apache 2.0, а также через Qwen Chat и API Alibaba Cloud DashScope.
Сокращения
RL = Reinforcement Learning — обучение с подкреплением
AGI = Artificial General Intelligence — общий искусственный интеллект
API = Application Programming Interface — интерфейс программирования приложений
Источник: Alibaba Qwen — оригинал

Наши прошлые публикации по теме

Есть свежие новости