Alibaba Qwen представляет QVQ: мультимодальную модель для визуального рассуждения
Alibaba/Qwen
Команда Qwen из Alibaba выпустила экспериментальную модель QVQ-72B-Preview, предназначенную для многоступенчатого визуального рассуждения. Модель набрала 70,3 балла на бенчмарке MMMU, превзойдя Qwen2-VL-72B-Instruct, и значительно улучшила результаты по математическим задачам. В планах команды — объединить в модели больше модальностей для продвижения к AGI.
Команда Qwen из Alibaba представила QVQ-72B-Preview — экспериментальную модель с открытым весом для мультимодального рассуждения, построенную на базе Qwen2-VL-72B. Модель демонстрирует улучшенные способности к визуальному анализу и сложному решению задач, набирая 70,3 балла на бенчмарке MMMU и показывая значительный прогресс по сравнению с Qwen2-VL-72B-Instruct на математических бенчмарках MathVista, MathVision и OlympiadBench. QVQ особенно сильна в пошаговом аналитическом мышлении, однако имеет ограничения: склонность к смешиванию языков, зацикливанию в рассуждениях, потере фокуса на изображении и галлюцинациям. Разработчики подчеркивают, что модель не заменяет Qwen2-VL-72B-Instruct и требует осторожного применения. В будущем Qwen планирует расширять возможности модели, добавляя новые модальности для продвижения к AGI.
- Сокращения
- MMMU = Massive Multi-Modal Understanding — массовое мультимодальное понимание
- AGI = Artificial General Intelligence — общий искусственный интеллект
Источник: Alibaba Qwen —
оригинал
