ModelsOpen Source 🇨🇳 28.07.2026 19:03

Alibaba выпускает Qwen2-Audio: новая аудио-языковая модель с голосовым чатом и анализом

Alibaba/QwenAlibaba/Qwen
Alibaba представила Qwen2-Audio — новую версию аудио-языковой модели, поддерживающую голосовой чат без ASR, анализ звуков, музыки и речи, а также более 8 языков. Модели Qwen2-Audio-7B и Qwen2-Audio-7B-Instruct открыты в Hugging Face и ModelScope. Производительность превосходит предыдущие SOTA на нескольких бенчмарках.
Alibaba выпустила Qwen2-Audio, следующую версию Qwen-Audio, способную принимать аудио- и текстовые входы и генерировать текст. Впервые пользователи могут отдавать голосовые команды без модулей ASR. Модель умеет анализировать аудиоинформацию (речь, звуки, музыку) по текстовым инструкциям и поддерживает более 8 языков, включая китайский, английский, кантонский, французский, итальянский, испанский, немецкий и японский. Веса моделей Qwen2-Audio-7B и Qwen2-Audio-7B-Instruct открыты на Hugging Face и ModelScope. В бенчмарках LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound и AIR-Benchmark Qwen2-Audio значительно превосходит предыдущие SOTA и Qwen-Audio. Архитектура основана на языковой модели Qwen и аудиоэнкодере, обучение включает мультизадачный претрейн, supervised finetuning и direct preference optimization. В будущем планируется обучение на больших наборах данных, поддержка аудио длиннее 30 секунд и более крупные модели.
Сокращения
ASR = Automatic Speech Recognition — автоматическое распознавание речи
LLM = Large Language Model — большая языковая модель
SOTA = State Of The Art — передовой уровень
Source: Alibaba Qwen — original
Our earlier posts on this topic ↓
Fresh news