МоделиОткрытый код 🇺🇸 23.07.2026 14:04

Лучшие открытые ASR-модели 2026 года: сравнение WER, языков, задержки и лицензий

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta
Рынок открытого распознавания речи перестал быть монокультурой Whisper. За последние 12 месяцев появилось множество моделей с разницей в WER менее 1%. Теперь решающими факторами при выборе стали лицензия, языковое покрытие, поддержка стриминга и стоимость за час аудио. Статья сравнивает лидеров по этим параметрам.
Открытое распознавание речи перестало быть монокультурой Whisper. В марте 2026 года Cohere выпустила Transcribe — модель 2B под лицензией Apache 2.0, занявшую первое место в лидерборде Hugging Face Open ASR со средним показателем WER 5,42%. Через пять недель IBM представила Granite Speech 4.1 2B с WER 5,33%. С тех пор ARK-ASR-3B и MOSS-Transcribe-preview-2B показали ещё более низкие значения. Разница между топ-моделями составляет менее одного пункта WER, поэтому решающими факторами при выборе стали лицензия, языковое покрытие, поддержка стриминга и стоимость. Cohere Transcribe (2B, Apache 2.0, 14 языков) — первая по-настоящему продакшен-модель, загруженная более 620 000 раз за месяц. Granite Speech 4.1 2B (Apache 2.0, 6 языков, двунаправленный перевод речи, ключевые слова) обучена на 174 000 часов. Canary-Qwen-2.5B (CC-BY-4.0, английский) работает в двух режимах — чистая транскрипция и LLM-режим с ответами на вопросы по транскрипту. Qwen3-ASR-1.7B (Apache 2.0) покрывает 52 языка и диалекта, включая 22 диалекта китайского. Среди моделей с высокой пропускной способностью лидирует Parakeet TDT 0.6B v3 (CC-BY-4.0, RTFx 3332,74, 25 европейских языков). Granite Speech 4.1 2B-NAR — неавторегрессионная модель с RTFx ~1820. Для стриминга выделяются Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 языков, задержка от 80 мс) и Kyutai STT (CC-BY-4.0, встроенный семантический VAD). Meta выпустила Omnilingual ASR (Apache 2.0), поддерживающую более 1600 языков, а Whisper large-v3 (MIT, 99 языков) остаётся лучшим вариантом для проектов, где важна самая свободная лицензия. Среди исследовательских новинок — diffusion-gemma-asr от стартапа Interfaze, генерирующая транскрипты параллельной диффузией, и MOSS-Transcribe-Diarize 0.9B (Apache 2.0), выдающая метки говорящих и таймстампы за один проход. Автор рекомендует выбирать модель в следующем порядке: лицензия, языковое покрытие, потоковый или пакетный режим, затем собственные замеры WER и стоимости. Главный вывод: модель с открытым весом 2B под пермиссивной лицензией теперь превосходит то, что закрытые API предлагали 18 месяцев назад, и оставшийся выбор — это вопрос закупок, а не исследований.
Сокращения
ASR = Automatic Speech Recognition — автоматическое распознавание речи
WER = Word Error Rate — частота ошибок в словах
VAD = Voice Activity Detection — детекция голосовой активности
LLM = Large Language Model — большая языковая модель
CER = Character Error Rate — частота ошибок в символах
CTC = Connectionist Temporal Classification — коннекционистская временная классификация
GPU = Graphics Processing Unit — графический процессор
API = Application Programming Interface — программный интерфейс приложения
RTFx = Real-Time Factor — коэффициент реального времени
MIT = Massachusetts Institute of Technology license — лицензия MIT
Источник: MarkTechPost — оригинал

Наши прошлые публикации по теме

Есть свежие новости