Qwen2.5-1M: Open Source модели с контекстом до 1 миллиона токенов
Alibaba/Qwen
Alibaba Qwen выпустила открытые модели Qwen2.5-7B-Instruct-1M и Qwen2.5-14B-Instruct-1M, поддерживающие контекст до 1 млн токенов. Для ускорения инференса представлен фреймворк на основе vLLM с разреженным вниманием, обеспечивающий ускорение в 3–7 раз.
Команда Qwen из Alibaba выпустила открытые модели Qwen2.5-7B-Instruct-1M и Qwen2.5-14B-Instruct-1M, которые впервые среди открытых моделей Qwen поддерживают контекстную длину до 1 миллиона токенов. Для эффективного развёртывания полностью открыт фреймворк инференса на основе vLLM, интегрированный с методами разреженного внимания, что позволяет обрабатывать входные данные длиной 1 млн токенов в 3–7 раз быстрее. Модели превосходят версии с 128K токенов в задачах на длинный контекст, а 14B-версия обходит GPT-4o-mini и Qwen2.5-Turbo. При этом производительность на коротких текстах сохраняется на уровне 128K-версий. Ключевые технические приёмы включают: прогрессивное обучение с увеличением контекста до 256K токенов, экстраполяцию длины с помощью Dual Chunk Attention для достижения 1M токенов без дополнительного обучения, а также разреженное внимание на базе MInference с улучшениями — интеграция с чанкованным prefillem, экстраполяцией длины и уточнением разреженности для длинных последовательностей. Для локального развёртывания требуется не менее 120 ГБ видеопамяти для 7B-модели и 320 ГБ для 14B-модели при обработке 1 млн токенов. Даны инструкции по установке кастомной версии vLLM и запуску OpenAI-совместимого API.
- Сокращения
- vLLM = Virtual Large Language Model — виртуальная большая языковая модель
- GPU = Graphics Processing Unit — графический процессор
- VRAM = Video Random Access Memory — видеопамять
- API = Application Programming Interface — программный интерфейс приложения
- RoPE = Rotary Position Embedding — вращательное позиционное встраивание
- DCA = Dual Chunk Attention — двойное чанковое внимание
Источник: Alibaba Qwen —
оригинал
