DeepSeek представила DeepSeek-Prover-V2: рекурсивный поиск доказательств и новый бенчмарк
DeepSeek
Компания DeepSeek AI анонсировала открытую модель DeepSeek-Prover-V2 для формального доказательства теорем в среде Lean 4. Модель использует рекурсивный пайплайн доказательств и холодный старт с генерацией данных от DeepSeek-V3, достигая 88,9% на MiniF2F-test. Также представлен бенчмарк ProverBench из 325 задач для оценки математических рассуждений.
DeepSeek AI выпустила DeepSeek-Prover-V2 — открытую большую языковую модель для формального доказательства теорем в среде Lean 4. Ключевое новшество — рекурсивный пайплайн доказательств, в котором DeepSeek-V3 разбивает сложные теоремы на подцели и формализует их, а модель на 7 миллиардов параметров ищет доказательства для каждой подцели. Полученные корректные доказательства объединяются с цепочкой рассуждений DeepSeek-V3, создавая синтетический набор данных для обучения. Затем модель дообучается на этих данных с подкреплением, где наградой служит бинарная обратная связь «правильно/неправильно». Флагманская версия DeepSeek-Prover-V2-671B с 671 миллиардом параметров достигла 88,9% правильных доказательств на тесте MiniF2F и решила 49 из 658 задач PutnamBench. Также представлен бенчмарк ProverBench, включающий 325 задач — 15 из последних соревнований AIME и 310 из учебников и туториалов. Модель выпущена в двух размерах: 7B и 671B параметров на базе DeepSeek-V3-Base и DeepSeek-Prover-V1.5-Base соответственно; у 7B-версии длина контекста увеличена до 32 тысяч токенов.
Источник: Synced —
оригинал
