Alibaba Qwen представляет Qwen2.5: новые модели с улучшенными знаниями, кодированием и математикой
Alibaba/Qwen
Команда Alibaba Qwen выпустила серию языковых моделей Qwen2.5, включающую семь открытых моделей от 0,5B до 72B параметров. Новинки отличаются увеличенным до 18 триллионов токенов предобучающим набором данных, улучшенными показателями в знаниях, кодировании и математике, а также поддержкой контекста до 128K токенов.
Команда Alibaba Qwen анонсировала серию языковых моделей Qwen2.5, которые представляют собой декодерные плотные модели с открытым исходным кодом. В серию вошли семь моделей: Qwen2.5-0.5B, Qwen2.5-1.5B, Qwen2.5-3B, Qwen2.5-7B, Qwen2.5-14B, Qwen2.5-32B и Qwen2.5-72B. По сравнению с предыдущей серией Qwen2, модели Qwen2.5 получили ряд улучшений, включая расширение предобучающего набора данных с 7 до 18 триллионов токенов, что привело к значительному приросту знаний — на MMLU показатели Qwen2.5-7B и Qwen2.5-72B выросли с 70,3 до 74,2 и с 84,2 до 86,1 соответственно. Благодаря технологиям Qwen2.5-Coder и Qwen2-Math улучшились способности в кодировании и математике: Qwen2.5-72B-Instruct достиг 55,5 на LiveCodeBench и 83,1 на MATH, превзойдя Qwen2-72B-Instruct. Кроме того, модели демонстрируют лучшую согласованность с человеческими предпочтениями (Arena-Hard вырос с 48,1 до 81,2 для Qwen2.5-72B-Instruct), улучшенное следование инструкциям, генерацию длинных текстов (до 8K токенов) и структурированных выходных данных, особенно в формате JSON. Модели Qwen2.5-7B, Qwen2.5-14B и Qwen2.5-32B поддерживают контекст до 128K токенов, а Qwen2.5-0.5B, Qwen2.5-1.5B и Qwen2.5-3B — до 32K токенов. Большинство моделей лицензированы под Apache 2.0, за исключением Qwen2.5-3B (Qwen Research License) и Qwen2.5-72B (Qwen License). Также доступны дополнительные модели Qwen-Plus и Qwen-Turbo через API Alibaba Cloud Model Studio.
- Сокращения
- API = Application Programming Interface — интерфейс программирования приложений
- JSON = JavaScript Object Notation — формат обмена данными на основе JavaScript
- MMLU = Massive Multitask Language Understanding — массовое мультизадачное понимание языка
- MATH = Mathematics Aptitude Test of Heuristics — тест на математические способности
- BBH = BIG-Bench Hard — сложная версия бенчмарка BIG-Bench
- GPQA = Graduate-Level Physics and Mathematics Questions — вопросы по физике и математике уровня выпускника
- ARC-C = Abstraction and Reasoning Corpus - Challenge — корпус абстракции и рассуждений - задача
- GSM8K = Grade School Math 8K — математика для начальной школы 8K
- HumanEval = Human Evaluation of Code Generation — человеческая оценка генерации кода
- MBPP = Mostly Basic Programming Problems — в основном базовые задачи программирования
- MultiPL-E = Multi-language Programming Language Evaluation — многоязычная оценка языков программирования
Источник: Alibaba Qwen —
оригинал
