МоделиОткрытый код 🇨🇳 21.07.2026 01:04

Alibaba Qwen выпустила Qwen2-Audio: голосовой чат и аудиоанализ без ASR

Alibaba/QwenAlibaba/Qwen
Команда Alibaba Qwen представила Qwen2-Audio — новую версию аудио-языковой модели, способную принимать на вход аудио и текст и выдавать текст. Модель поддерживает голосовой чат (без использования ASR), аудиоанализ речи, звуков и музыки, а также более 8 языков. Веса моделей Qwen2-Audio-7B и Qwen2-Audio-7B-Instruct открыты на Hugging Face и ModelScope.
Alibaba Qwen объявила о выпуске Qwen2-Audio — следующей версии аудио-языковой модели Qwen-Audio. Модель способна принимать аудио- и текстовые входы и генерировать текстовые выходы. Ключевая особенность — голосовой чат: пользователи могут отдавать команды голосом без использования модуля ASR. Модель также поддерживает аудиоанализ, включая речь, звуки и музыку, и понимает более 8 языков и диалектов: китайский, английский, кантонский, французский, итальянский, испанский, немецкий и японский. Qwen2-Audio доступна в двух версиях: Qwen2-Audio-7B и Qwen2-Audio-7B-Instruct, веса открыты на Hugging Face и ModelScope. В бенчмарках модель превосходит предыдущие SOTA и Qwen-Audio. Архитектура включает языковую модель Qwen и аудиоэнкодер, на которые последовательно применяются мультизадачный предтренинг, supervised fine-tuning и direct preference optimization. Модель официально поддерживается трансформерами Hugging Face.
Сокращения
ASR = Automatic Speech Recognition — автоматическое распознавание речи
SOTA = State of the Art — современное состояние дел / лучшие результаты
Источник: Alibaba Qwen — оригинал

Наши прошлые публикации по теме

Есть свежие новости