МоделиИсследования 🇺🇸 20.07.2026 09:05

От DeepSeek V3 к V3.2: архитектура, разреженное внимание и обновления RL

DeepSeekDeepSeek
Себастьян Рашка подробно разбирает эволюцию флагманских моделей DeepSeek с открытым весом от V3 до V3.2. В статье рассматриваются архитектурные изменения, включая Multi-Head Latent Attention (MLA) и новое разреженное внимание DeepSeek Sparse Attention (DSA), а также переход от выделенной модели рассуждений к гибридной.
Себастьян Рашка выпустил подробный анализ эволюции моделей DeepSeek с открытым весом — от V3, выпущенного в декабре 2024 года, до новейшей V3.2, вышедшей в конце 2025 года. Он отмечает, что V3 изначально не была популярна, но модель рассуждений DeepSeek R1 (на той же архитектуре) сделала DeepSeek одним из ведущих открытых решений. После R1 прошло около 11 месяцев без крупных релизов, что породило слухи о «затухании» команды, однако Рашка считает это нормальным сроком для крупной LLM. За это время вышли небольшие обновления: V3.1 (гибридная модель с возможностью переключения между режимами чата и рассуждений) и V3.2-Exp (экспериментальная модель с новым механизмом разреженного внимания DeepSeek Sparse Attention, DSA). DSA использует «молниеносный индексатор» и селектор токенов для выборочного сокращения контекста, что повышает эффективность обучения и инференса, особенно для длинных контекстов. Финальная V3.2 основана на V3.2-Exp и демонстрирует производительность на уровне GPT-5 и Gemini 3.0 Pro, оставаясь открытой моделью. Рашка также обсуждает эволюцию типов моделей: от выделенных моделей рассуждений (R1) к гибридным (V3.1, V3.2), а также сравнивает подходы разных команд (Qwen3, OpenAI).
Сокращения
MLA = Multi-Head Latent Attention — многоголовое латентное внимание
DSA = DeepSeek Sparse Attention — разреженное внимание DeepSeek
RLVR = Reinforcement Learning with Verifiable Rewards — обучение с подкреплением на проверяемых вознаграждениях
GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
PPO = Proximal Policy Optimization — проксимальная оптимизация политики
RLHF = Reinforcement Learning with Human Feedback — обучение с подкреплением на основе человеческой обратной связи
MoE = Mixture of Experts — смесь экспертов
Источник: Sebastian Raschka — оригинал

Наши прошлые публикации по теме

Есть свежие новости