DeepSeek

Latest AI news, models and releases from DeepSeek. ['DeepSeek', 'DeepSeek 3.1', 'DeepSeek-4-pro', 'DeepSeek API', 'deepseek-coder-v2', 'DeepSeek-Coder-V2-Lite', 'DeepSeek-GRM', 'DeepSeekMath-V2', 'DeepSeekMoE', 'DeepSeek-Prover-V1.5-Base', 'DeepSeek-Prover-V2', 'DeepSeek-Prover-V2-671B', 'DeepSeek-Prover-V2-7B', 'DeepSeek R1', 'DeepSeek-R1', 'DeepSeek R1-0528', 'DeepSeek-R1-0528', 'DeepSeek-R1-671B', 'DeepSeek-R1-Distilled-Llama-70B', 'DeepSeek-R1-Distilled-Qwen-32B', 'DeepSeek-R1-Distill-Qwen-32B', 'DeepSeek-R1-Zero', 'DeepSeek R2', 'DeepSeek-R2', 'DeepSeek Sparse Attention (DSA)', 'DeepSeek-V2', 'DeepSeek-V2.5', 'DeepSeek V3', 'DeepSeek-V3', 'DeepSeek V3.1', 'DeepSeek V3.1-Terminus', 'DeepSeek v3.2', 'DeepSeek V3.2', 'DeepSeek-V3.2', 'DeepSeek V3.2-Exp', 'DeepSeek-V3-Base', 'DeepSeek V3/R1', 'DeepSeek v4', 'DeepSeek V4', 'DeepSeek-V4']

Research 🇺🇸

State of LLMs in 2025: Progress, Challenges, and Predictions

In 2025, LLM development was dominated by reasoning models using reinforcement learning with verifiable rewards (RLVR) and the GRPO algorithm, sparked by DeepSeek R1. Key trends include a focus on inference-time scaling, MoE architectures, and efficiency tweaks like Gated DeltaNets. Academic research highlighted GRPO variants with improvements such as zero gradient filtering and token-level loss.

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
Sebastian Raschka27.07 · 17:03
Fresh news