Модели 🇨🇳 20.07.2026 19:04

Qwen2.5-Max: исследование возможностей крупномасштабной модели MoE

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic MetaMeta
Alibaba Cloud представила Qwen2.5-Max — крупномасштабную модель MoE, обученную на более чем 20 триллионах токенов. Модель превосходит DeepSeek V3 по нескольким бенчмаркам, включая Arena-Hard и LiveCodeBench. API модели доступно через Alibaba Cloud.
Команда Qwen объявила о выпуске Qwen2.5-Max, крупномасштабной модели архитектуры Mixture-of-Experts (MoE), обученной на более чем 20 триллионах токенов с последующей дообучкой методами SFT и RLHF. Модель доступна в Qwen Chat, а также через API на Alibaba Cloud с именем qwen-max-2025-01-25. API совместим с OpenAI API. По результатам тестов Qwen2.5-Max (инструктивная версия) превосходит DeepSeek V3 в бенчмарках Arena-Hard, LiveBench, LiveCodeBench и GPQA-Diamond, показывая конкурентоспособные результаты в MMLU-Pro. Базовая модель Qwen2.5-Max сравнивалась с DeepSeek V3, Llama-3.1-405B и Qwen2.5-72B и показала значительное преимущество по большинству метрик. В будущем команда планирует улучшать мыслительные способности модели за счёт масштабированного обучения с подкреплением.
Сокращения
MoE = Mixture of Experts — смесь экспертов
SFT = Supervised Fine-Tuning — обучение с учителем (дообучение на размеченных данных)
RLHF = Reinforcement Learning from Human Feedback — обучение с подкреплением на основе обратной связи человека
API = Application Programming Interface — программный интерфейс приложения
Источник: Alibaba Qwen — оригинал

Наши прошлые публикации по теме

Есть свежие новости