Программный стек инференса NVIDIA снижает стоимость токенов на платформе Blackwell

NVIDIANVIDIA DeepSeekDeepSeek CognitionCognition DigitalOceanDigitalOcean Hippocratic AIHippocratic AI Together AITogether AI CursorCursor
NVIDIA представила свой полный программный стек инференса, который на платформе Blackwell снижает стоимость токенов до 5 раз на модели DeepSeek V4. Стек включает три уровня: производственная эксплуатация, ускорение приложений и доступ к инфраструктуре, а ключевые оптимизации в совокупности увеличивают пропускную способность до 20 раз.
NVIDIA рассказала, как её программный стек инференса помогает снижать стоимость токена для ИИ-фабрик. На платформе Blackwell стек уже за месяц сократил стоимость токенов до 5 раз на модели DeepSeek V4. Стек включает три уровня: производственная эксплуатация (координация распределённого обслуживания, оркестрация, автомасштабирование и управление памятью), ускорение приложений (высокопроизводительный запуск моделей с возможностью настройки) и доступ к инфраструктуре (доступ к возможностям GPU, сетей и памяти без ручного управления). Индивидуальные оптимизации, такие как разделённое обслуживание, крупномасштабный параллелизм экспертов на NVLink, точность NVFP4 и многотокенное предсказание, в совокупности увеличивают пропускную способность до 20 раз. Компании, использующие стек на Blackwell: Baseten (DeepSeek V4 Pro) — до 50% больше токенов в секунду на TensorRT-LLM; Cognition (NVIDIA Dynamo) — управление GPU для масштабирования RL-нагрузок; Deep Infra — обслуживание моделей вроде DeepSeek V4; DigitalOcean с Hippocratic AI (30% рост пропускной способности, время первого ответа менее 0,5 секунды на 10 млн звонков); Together AI с Cursor — ускорение пути от оптимизаций до продакшена. Открытые фреймворки, такие как PyTorch, vLLM и SGLang, работающие на CUDA, позволяют новым моделям и оптимизациям сразу давать прирост производительности на NVIDIA GPU. Например, DFlash speculative decode даёт до 15x прироста пропускной способности, FastVideo генерирует 1080p видео менее чем за 5 секунд. Открытая экосистема создаёт цикл: больше разработчиков оптимизируют CUDA-пути, больше продакшен-развёртываний дают обратную связь, и каждое улучшение снижает стоимость токена.
Сокращения
GPU = Graphics Processing Unit — графический процессор
CPU = Central Processing Unit — центральный процессор
DPU = Data Processing Unit — процессор обработки данных
NVLink = NVIDIA NVLink — межсоединение NVIDIA NVLink
NVFP4 = NVIDIA FP4 — 4-битная точность NVIDIA
CUDA = Compute Unified Device Architecture — архитектура унифицированных вычислительных устройств
Источник: NVIDIA blog — оригинал

Наши прошлые публикации по теме

Есть свежие новости