ИсследованияМодели 🇺🇸 20.07.2026 17:04

DeepSeek представила SPCT — новый метод масштабирования инференса для улучшения моделей вознаграждения и намекнула на R2

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek опубликовала исследование, в котором предложила метод Self-Principled Critique Tuning (SPCT) для повышения масштабируемости общих моделей вознаграждения на этапе инференса. Компания также намекнула на скорый выход следующего поколения своей LLM — модели R2, которая, вероятно, будет основана на этом подходе.
Компания DeepSeek, известный игрок в области больших языковых моделей, опубликовала исследовательскую статью, в которой описала новую технику для улучшения масштабируемости общих моделей вознаграждения на этапе инференса. Одновременно компания намекнула на скорый выход своей модели следующего поколения — R2. Статья под названием «Inference-Time Scaling for Generalist Reward Modeling» представляет метод SPCT (Self-Principled Critique Tuning), который позволяет GRM динамически генерировать принципы и критику для оптимизации вознаграждения. Метод включает два этапа: rejection fine-tuning для холодного старта и rule-based online RL для дальнейшей оптимизации. Для эффективного масштабирования используется параллельная выборка: DeepSeek-GRM генерирует несколько наборов принципов и критики, а итоговое вознаграждение выбирается голосованием с помощью мета-модели вознаграждения. Эксперименты показали, что SPCT значительно улучшает качество и масштабируемость GRM, превосходя существующие методы. Учитывая акцент DeepSeek на чистом обучении с подкреплением для улучшения рассуждений, ожидается, что R2 будет включать наработки из этого исследования. Работа опубликована на arXiv.
Сокращения
SPCT = Self-Principled Critique Tuning — настройка с самопринципиальной критикой
GRM = General Reward Model — общая модель вознаграждения
RL = Reinforcement Learning — обучение с подкреплением
LLM = Large Language Model — большая языковая модель
Источник: Synced — оригинал

Наши прошлые публикации по теме

Есть свежие новости