МоделиИсследования 🇨🇳 20.07.2026 23:04

QwQ: глубокая рефлексия на границах неизвестного

Alibaba/QwenAlibaba/Qwen
Команда Qwen из Alibaba представила экспериментальную модель QwQ-32B-Preview, нацеленную на стимулирование рассуждений в ИИ. Модель демонстрирует высокие результаты в математике и программировании, но имеет ограничения, включая смешение языков и рекурсивные циклы рассуждений.
Alibaba выпустила экспериментальную исследовательскую модель QwQ-32B-Preview (произносится как /kwju:/, похоже на слово quill). Модель предназначена для углублённого анализа и решения сложных задач в математике и кодировании. Она достигает 65,2% на бенчмарке GPQA (Graduate-Level Google-Proof Q&A Benchmark), 50,0% на AIME (American Invitation Mathematics Evaluation), 90,6% на MATH-500 и 50,0% на LiveCodeBench. Однако модель имеет ограничения: склонность к смешению языков и неожиданному переключению между ними, рекурсивные циклы рассуждений (циклические шаблоны, приводящие к длинным ответам без окончательного решения), требует усиленных мер безопасности, а также показывает более слабые результаты в задачах на здравый смысл и тонкое понимание языка. Разработчики подчёркивают, что это ранний этап, и модель продолжает учиться.
Сокращения
GPQA = Graduate-Level Google-Proof Q&A Benchmark — бенчмарк вопросов и ответов уровня магистратуры, устойчивый к поиску в Google
AIME = American Invitation Mathematics Evaluation — Американская пригласительная математическая оценка
MATH-500 = 500 test cases of the MATH benchmark — 500 тестовых случаев бенчмарка MATH
Источник: Alibaba Qwen — оригинал

Наши прошлые публикации по теме

Есть свежие новости