ИсследованияМодели 🇺🇸 20.07.2026 17:04

SRPO от Kuaishou: десятикратное ускорение GRPO с двухэтапным обучением и пересэмплированием истории

OpenAIOpenAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
Исследователи Kuaishou представили SRPO — новый метод RL для LLM, который за 1/10 шагов R1-Zero достигает его уровня на AIME24 и LiveCodeBench. SRPO решает проблемы GRPO: конфликты доменов, низкую эффективность выборки и преждевременное насыщение. Ключевые идеи: двухэтапное обучение (сначала математика, потом код) и History Resampling для отбора информативных примеров. Модель SRPO-Qwen-32B открыта.
Команда Kwaipilot из Kuaishou предложила фреймворк Two-Staged history-Resampling Policy Optimization (SRPO), направленный на повышение эффективности RL для LLM. Стандартный GRPO страдает от конфликтов при смешивании математических и кодовых данных, низкой вариативности наград в группе и преждевременной остановки роста производительности. SRPO использует двухэтапное обучение: на первом этапе модель тренируется только на сложных математических задачах, развивая длинные цепочки рассуждений; на втором добавляются задачи по программированию, что позволяет интегрировать навыки. Для борьбы с неэффективными градиентами введён History Resampling: из эпохи в эпоху исключаются примеры, на которых все роллауты верны (они не дают полезного сигнала), а сохраняются образцы с разнородными или полностью неверными результатами. Это увеличивает долю информативных градиентов и стабилизирует рост длины ответов. На основе Qwen2.5-32B и только RL (без SFT) SRPO достиг на AIME24 50 баллов, на LiveCodeBench 41.6, превзойдя DeepSeek-R1-Zero-32B при затрате лишь 1/10 шагов обучения. В ходе обучения модель спонтанно научилась проверять математические решения с помощью кода и демонстрировать рефлексию, перепроверку и поиск. Команда опубликовала технический отчёт и открыла модель SRPO-Qwen-32B на HuggingFace.
Сокращения
GRPO = Group Relative Policy Optimization — групповая оптимизация политики на основе предпочтений
SRPO = Two-Staged history-Resampling Policy Optimization — двухэтапная оптимизация политики с пересэмплированием истории
RL = Reinforcement Learning — обучение с подкреплением
LLM = Large Language Model — большая языковая модель
Источник: Synced — оригинал

Наши прошлые публикации по теме

Есть свежие новости