iFlytek выпускает Spark Token Factory — интеллектуальную маршрутизацию и управление корпоративными ИИ-моделями нового поколения
科大讯飞
Китайская компания iFlytek (科大讯飞) 19 июля представила платформу Spark Token Factory (星火Token Factory), предназначенную для корпоративных клиентов. Решение обеспечивает унифицированное подключение, интеллектуальную маршрутизацию и оптимизацию затрат на большие языковые модели, помогая предприятиям масштабировать внедрение ИИ. Платформа предлагает трёхуровневую классификацию задач (L1–L3) и распределяет их по подходящим моделям, а также повышает эффективность локального инференса на оборудовании Ascend до 5 раз по сравнению с vLLM-Ascend.
Компания iFlytek (科大讯飞) анонсировала платформу Spark Token Factory (星火Token Factory) — корпоративное решение для управления ИИ-моделями. Платформа выступает промежуточным слоем между бизнес-приложениями и большими языковыми моделями, предоставляя унифицированное подключение, интеллектуальную маршрутизацию, оптимизацию затрат на токены и безопасное управление. Основной элемент — интеллектуальный маршрутизатор, который на основе многомерных признаков (длина промпта, правила, количество диалогов и т. д.) классифицирует запросы по трём уровням сложности (L1–L3) и распределяет их между подходящими моделями с учётом качества, стоимости, задержки, доступности и безопасности. Средняя задержка принятия решения — менее 100 мс. Для частных развёртываний на основе китайского оборудования Ascend платформа оптимизирует инференс: применены сжатие моделей, уточнение точности, распараллеливание вычислений, управление кешем KV и ускорение декодирования. В тестах Spark Token Factory показала до 5-кратного повышения эффективности инференса по сравнению с открытым фреймворком vLLM-Ascend, а задержка первого токена снижена на 30–40%. Также реализована система безопасности с разделением полномочий (управление, операции, аудит), неизменяемые журналы аудита, защита чувствительных данных (персональные и корпоративные) и детальная привязка затрат к каждому запросу. Платформа даёт полную прозрачность использования ресурсов через журналы, статистику токенов и анализ ROI, помогая предприятиям перейти от экспериментов к масштабной эксплуатации ИИ.
- Сокращения
- ROI = Return on Investment — возврат на инвестиции
- vLLM = Virtualized Large Language Model — виртуализированная большая языковая модель
Источник: QbitAI 量子位 —
оригинал
