Развертывание Kimi K3 на Amazon SageMaker HyperPod и Amazon EKS
Moonshot AI
vLLM
Amazon Web Services
Moonshot AI выпустила Kimi K3 — открытую модель с 2,8 трлн параметров, первую в классе 3 трлн. AWS предлагает два способа развертывания: SageMaker HyperPod и Amazon EKS. Модель требует специализированных GPU-инстансов p6-b300 и использует vLLM для инференса.
Moonshot AI выпустила модель Kimi K3 с открытыми весами, которая насчитывает 2,8 триллиона параметров и является первой открытой системой, достигающей класса 3 триллионов параметров. Архитектура включает Kimi Delta Attention, Gated Multi Head Latent Attention и Stable LatentMoE, активируя 16 из 896 экспертов на токен, что дает 104 миллиарда активных параметров. Модель поддерживает контекст в 1 миллион токенов и является мультимодальной (текст и изображения). Веса доступны на Hugging Face в формате MXFP4, для инференса рекомендуется vLLM. Для развертывания требуются инстансы p6-b300 с 8 GPU NVIDIA B300 Blackwell Ultra. AWS предлагает два способа: SageMaker HyperPod с Inference Operator и автономный Amazon EKS с использованием Capacity Blocks. Оба способа обеспечивают OpenAI-совместимый API для вызовов. Статья содержит подробные шаги для каждого варианта, включая создание кластера, резервирование мощностей, установку драйверов и развертывание vLLM, а также рекомендации по очистке ресурсов.
- Сокращения
- MoE = Mixture of Experts — смесь экспертов
- EKS = Elastic Kubernetes Service — эластичный сервис Kubernetes
- GPU = Graphics Processing Unit — графический процессор
- MXFP4 = Microscaling Floating Point 4-bit — микромасштабируемая плавающая точка 4-бит
- S3 = Amazon Simple Storage Service — простой сервис хранения Amazon
- EC2 = Elastic Compute Cloud — эластичное облако вычислений
- IAM = Identity and Access Management — управление доступом и идентификацией
- VPC = Virtual Private Cloud — виртуальное частное облако
- FTP = Flexible Training Plan — гибкий план обучения
- MLA = Multi Head Latent Attention — многоголовое латентное внимание
- KDA = Kimi Delta Attention — дельта-внимание Kimi
Source: AWS ML blog —
original
