Alibaba Qwen выпускает ProcessBench и новые Process Reward Models для математических рассуждений
Alibaba/Qwen
Alibaba Qwen представила бенчмарк ProcessBench для оценки способности моделей выявлять ошибки в поэтапных математических рассуждениях, а также две новые Process Reward Models (PRM) на базе Qwen2.5-Math. Модели Qwen2.5-Math-PRM-7B и Qwen2.5-Math-PRM-72B превосходят существующие открытые PRM как в оценке Best-of-N, так и в ProcessBench.
Команда Alibaba Qwen выпустила бенчмарк ProcessBench и две новые Process Reward Models (PRM): Qwen2.5-Math-PRM-7B и Qwen2.5-Math-PRM-72B, дообученные на Qwen2.5-Math-7B-Instruct и Qwen2.5-Math-72B-Instruct соответственно. ProcessBench состоит из 3400 тестовых примеров, в основном Competition- и Olympiad-уровня, каждый из которых содержит пошаговое решение с аннотацией ошибок от экспертов; модель должна указать первый шаг с ошибкой или заключить, что все шаги верны. В оценке Best-of-N (N=8) на семи математических бенчмарках (GSM8K, MATH, Minerva Math, GaoKao 2023 En, OlympiadBench, College Math, MMLU STEM) Qwen2.5-Math-PRM-7B превзошла мажоритарное голосование (maj@8) в среднем на 1,4%, а Qwen2.5-Math-PRM-72B показала немного лучшую общую производительность, чем Qwen2.5-Math-RM-72B. В ProcessBench Qwen2.5-Math-PRM-7B превзошла все открытые модели и GPT-4o-0806, уступив лишь o1-mini. Обе новые PRM значительно превосходят существующие модели-аналоги. Авторы также отмечают, что Outcome Reward Model (ORM) Qwen2.5-Math-RM-72B проявила заметную способность выявлять пошаговые ошибки, превзойдя некоторые открытые PRM.
- Сокращения
- PRM = Process Reward Model — модель наград за процесс
- ORM = Outcome Reward Model — модель наград за результат
- BoN = Best-of-N — лучший из N
Источник: Alibaba Qwen —
оригинал
