МоделиГенерация медиа 🇨🇳 21.07.2026 03:03

ИИ-озвучка вступает в «эру исполнения»: Alibaba Qwen-Audio-3.0-TTS возглавил мировой рейтинг

Alibaba/QwenAlibaba/Qwen
Alibaba обновила модель синтеза речи Qwen-Audio-3.0-TTS, которая заняла первое место в мировом рейтинге TTS. Модель поддерживает 20 диалектов и точное управление интонацией, паузами и темпом. Система использует подход «производитель-критик» (actor-critic) для оценки естественности речи.
Компания Alibaba выпустила обновлённую версию своей речевой модели Qwen-Audio-3.0-TTS, которая возглавила мировой рейтинг TTS Arena. Модель позволяет точно управлять интонацией, паузами, темпом и ударениями с помощью специальных меток в тексте. Она поддерживает 20 китайских диалектов (включая гуандунский, шанхайский и сычуаньский) и может подражать голосу диктора, сохраняя при этом естественность. В основе лежит архитектура «производитель-критик» (actor-critic), где одна нейросеть генерирует речь, а другая оценивает её натуральность и на основе этой оценки дообучает первую. Для достижения высокой выразительности используются мелкозернистые акустические маркеры (эмоции, тон, темп), а также инструменты паузы (тишина 20–500 мс). Качество синтеза оценивается как «актёрская игра», а не просто чтение текста. Больше технических деталей не раскрыто.
Сокращения
TTS = Text-to-Speech — синтез речи по тексту
Источник: QbitAI 量子位 — оригинал

Наши прошлые публикации по теме

Есть свежие новости