Moonshot AI

Latest AI news, models and releases from Moonshot AI. ['GLM 5.2', 'GLM-5.2', 'Hermes', 'K2', 'K2.6', 'K3', 'K3-mini', 'K3-MoE', 'Kimi', 'Kimi 2.6', 'Kimi-2.6', 'Kimi 3', 'Kimi 3T', 'Kimi Hosted Agent', 'Kimi k1.5', 'Kimi K1.5', 'kimi-k2', 'Kimi K2', 'kimi-k2-0711-preview', 'Kimi K2.5', 'Kimi-K2.5-1T-A32B', 'Kimi K2.6', 'Kimi K2.7', 'Kimi K2.7 Code', 'Kimi K2 Thinking', 'Kimi K3', 'Kimi-K3', 'Kimi K3.5', 'Kimi K4', 'Kimi K5', 'Kimi Linear', 'Kivine', 'Krea 2', 'Krea 2 Turbo', 'Mamba', 'Mamba-2', 'Mamba-3', 'MiniCPM-RobotManip', 'MiniCPM-RobotTrack', 'Minimax']

Models 🇨🇳

From GPT-2 to Kimi K3: Scale Grows 22,580x in Seven Years, Main Architecture Thread Builds a "Memory Operating System"

The technical evolution of large models from GPT-2 to Kimi K3 shows how AI architecture moves from "remembering everything" to "selective memory". KV Cache solves generation efficiency, Linear Attention explores more efficient long-term memory, DeltaNet and Kimi Linear enable models to learn to update, forget, and manage information. Kimi K3 has 2.8 trillion parameters, equivalent to about 22,580 GPT-2 models.

Moonshot AIMoonshot AI
InfoQ 中国30.07 · 13:02
Fresh news