Mistral AI представила Voxtral TTS — мультиязычную модель синтеза речи с эмоциональной выразительностью
Mistral
ElevenLabs
Mistral AI запустила Voxtral TTS — модель синтеза речи с 4 миллиардами параметров, поддерживающую 9 языков и обеспечивающую реалистичную, эмоционально окрашенную речь с низкой задержкой. Модель доступна через API и Mistral Studio, стоимость — от $0,016 за 1 тыс. символов.
Mistral AI представила свою первую модель синтеза речи Voxtral TTS, предназначенную для создания естественной и эмоционально выразительной речи на девяти языках: английском, французском, немецком, испанском, нидерландском, португальском, итальянском, хинди и арабском. Модель содержит 4 миллиарда параметров и построена на базе Ministral 3B, включает трансформерный декодер на 3,4 млрд параметров, акустический трансформер на 390 млн и нейронный аудиокодек на 300 млн. Voxtral TTS поддерживает адаптацию к новому голосу по референсу длительностью от 3 секунд, а также демонстрирует возможность кросс-языковой адаптации без специального обучения — например, синтез английской речи с французским акцентом при использовании французского голоса-образца. Модель достигает задержки 70 мс для типового образца и фактора реального времени около 9,7x. Согласно собственным оценкам Mistral AI, Voxtral превосходит ElevenLabs Flash v2.5 по естественности при схожей задержке и сопоставим с ElevenLabs v3 по качеству. Модель доступна в Mistral Studio и через API по цене $0,016 за 1 тыс. символов, а также в открытом доступе на Hugging Face по лицензии CC BY NC 4.0.
- Сокращения
- API = Application Programming Interface — интерфейс программирования приложений
- TTS = Text-to-Speech — синтез речи из текста
- LLM = Large Language Model — большая языковая модель
- RTF = Real-Time Factor — фактор реального времени
- VQ = Vector Quantization — векторное квантование
- FSQ = Finite Scalar Quantization — конечное скалярное квантование
- NFE = Number of Function Evaluations — количество вызовов функции
Источник: Mistral AI —
оригинал
