МоделиИсследования 🇺🇸 20.07.2026 12:05

Весна для открытых LLM: 10 архитектур за январь–февраль 2026

Arcee AIArcee AI Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MiniMaxMiniMax CohereCohere DeepSeekDeepSeek
В статье представлен обзор десяти открытых моделей с весом, выпущенных в начале 2026 года, с акцентом на архитектурные сходства и различия. Среди ключевых моделей: Trinity Large от Arcee AI, Kimi K2.5 от Moonshot AI, Step 3.5 Flash от StepFun, Qwen3-Coder-Next от Alibaba Qwen, а также другие заметные релизы.
В обзоре рассмотрены десять открытых LLM, выпущенных с января по февраль 2026 года, с хронологическим описанием их архитектурных особенностей. Arcee AI представила Trinity Large — 400B-параметрическую MoE-модель с 13B активных параметров, использующую скользящее окно внимания (SWA) с соотношением local:global 3:1, QK-Norm, гейтированное внимание и DeepSeek-подобный MoE. Moonshot AI выпустила Kimi K2.5 — мультимодальную 1-триллионную модель на базе Kimi K2, которая по производительности сравнима с ведущими проприетарными моделями. StepFun анонсировала Step 3.5 Flash — 196B-параметрическую MoE-модель (11B активных) с Multi-Token Prediction (MTP-3), демонстрирующую высокую скорость инференса (100 токенов/с). Qwen3-Coder-Next от Alibaba — 80B модель с гибридом Gated DeltaNet и Gated Attention в соотношении 3:1, что обеспечивает нативную длину контекста 262k токенов и выдающиеся результаты на задачах кодирования. Также упомянуты другие модели: z.AI GLM-5, MiniMax M2.5, Nanbeige 4.1 3B, Qwen 3.5, Ling 2.5 1T / Ring 2.5 1T от Ant Group, Tiny Aya от Cohere, а также Sarvam 30B/105B в качестве дополнения. DeepSeek V4 ожидается в скором времени.
Сокращения
LLM = Large Language Model — большая языковая модель
MoE = Mixture of Experts — смесь экспертов
SWA = Sliding Window Attention — внимание со скользящим окном
MTP = Multi-Token Prediction — многотокенное предсказание
QKNorm = Query-Key Normalization — нормализация запросов и ключей
GQA = Grouped Query Attention — групповое внимание по запросам
RMSNorm = Root Mean Square Normalization — нормализация на основе среднеквадратичного значения
NoPE = No Positional Embeddings — без позиционных эмбеддингов
Источник: Sebastian Raschka — оригинал

Наши прошлые публикации по теме

Есть свежие новости