← БлогБлог · STT

Распознавание армянской речи: что выдают модели в шуме

Короткий ответ: из семи проверенных моделей армянскими буквами пишут четыре — две версии Whisper, Deepgram Nova-3 с явно указанным армянским и ElevenLabs Scribe, и у Whisper и Nova-3 ошибка от 43 % слов и выше даже без шума. 2 % у Scribe считать не надо: записи озвучены той же ElevenLabs, то есть Scribe тут слушает собственный голос.

Опубликовано Автор: Stanislav Shupilkin5 мин чтения

Пример: одна армянская запись — чисто и под шумом

Записи синтетические: текст озвучен голосом Sarah в ElevenLabs (модель eleven_v3), это не живой человек. Шум наложен скриптом. Ответы моделей — как есть, без правки. Под каждой карточкой — доля ошибочных слов из 44.

Запись 1 — без шума23 с
Эталон
Գրադարանը բացվում է առավոտյան ժամը իննին և փակվում երեկոյան յոթին։ Երկուշաբթի օրը մենք վերադարձնում ենք տասնհինգ գիրք և վերցնում ենք չորս նորը։ Ընթերցասրահում նստած են քսաներկու ուսանողներ, որոնք պատրաստվում են քննություններին։ Դասախոսությունը սկսվում է ժամը տասնմեկին, տևում է հիսուն րոպե, իսկ ընդմիջումը՝ քառորդ ժամ։
Whisper large-v3-turbo (Groq)ошибочных слов: 63,6 %
գրաթրանը բացվում է առավոցյան ժամը 9-ին և պակվում երեկոյան 7-ին։ 2-շապցի օրը մենք վերադարցնում ենք 15 գիրկ և վերցնում ենք 4 նորը։ ընդերցասրահում նստած են 22 ու սանողներ, որոնք պատրաստվում են կննություններին։ Դա սախոսությունը նսկսվում է ժամը 11-ին, տեվում է 50-րոպ է, իսկ ընդմիջումը կարորդ ժամ։
Deepgram Nova-3, язык hyошибочных слов: 47,7 %
Գրադարանը բացվում է առավոտյան ժամը 9ին 2շապտի օրը մենք վերադարձնում ենք 15 գիրք եւ Ընթերցասրահում նստած ենք 22 ուսանողներ, Դասախոսությունը սկսվում է ժամը 11ին, տեւում է 50 րոպե, իսկ ընդմիջումը՝ քառորդ ժամ,

Та же запись у двух других сервисов: Deepgram Nova-3 в режиме multi — «Gret herene bathsvume ara vodtien jamme innin, yvpackvume yerekoyan yottin…» (111 %), Fish Audio — «گر تهران بادسومه، آرزو تیانجامه…» (арабское письмо, 136 %).

Перевод эталона: «Библиотека открывается в девять утра и закрывается в семь вечера. В понедельник мы возвращаем пятнадцать книг и берём четыре новых. В читальном зале сидят двадцать два студента, которые готовятся к экзаменам. Лекция начинается в одиннадцать, длится пятьдесят минут, а перерыв — четверть часа.»

Запись 2 — шум, речь громче шума на 8 дБ28 с
Эталон
тот же текст
Whisper large-v3-turbo (Groq)ошибочных слов: 54,5 %
Վրաթրանը բացվում է առավոցյան ժամը 9-ին և պակվում երեկոյան 7-ին։ Վերկու շապթի օրը մենք վերադարցնում ենք 15 գիրկ և վերցնում ենք 4 նորը։ ընդերց ասրահում նստած են 22 ուսանողներ, որոնք պատրաստվում են կննություններին։ Դասախոսությունը նսկսվում է ժամը 11-ին, տեվում է 50 հոպե, իսկ ընդմիջումը կարորդ ժամ։
Deepgram Nova-3, язык hyошибочных слов: 43,2 %
Գրադարանը բացվում է առավոտյան ժամը 9ին 2շապտի օրը մենք վերադարձնում ենք 15 գիրք եւ վերցնում ենք 4 նոր Ընթերցասրահում նստած են 22 ուսանողներ, Դասախօսությունը սկսվում է ժամը 11ին, տեւում է 50 րոպե, իսկ ընդմիջումը՝ քառորդ ժամ։
Запись 3 — шум громче речи на 3 дБ, плюс дребезжащий тон28 с
Эталон
тот же текст
Whisper large-v3-turbo (Groq)ошибочных слов: 77,3 %
Վրաթերանը բատվում է առավոցյան ժամը ինին։ Ես հակվում երեկոյան դյոցն։ Երկուշավցի օրը մենք վերադարդնում ենք 15 դիտ և վերտնում ենք 4 նորը։ ընդհերծասրահում նստաբ ենց շանգերկում իսանողնեք, բորոնք պատրասվում ենք հնություններին։ Շասախոսիթինը նսկսվում է ժամը 11-ին։ տեվում են հիչ ունգոտ է, իսկ ընդնիչումը խարող սմ։
Deepgram Nova-3, язык hyошибочных слов: 54,5 %
Գրադարանը բացվում է առավոտյան ժամը 9ին եւ փակում երեկոյան գյուտն է։ Երկուշաբթի օրը մենք վերադարձնում ենք 15ից եւ վերցնում ենք կոշտն օրը։ Ընկերցասրահում նստած են ցանկեեւ ուսանողները, Դասապոչությունը նա սկսվում է ժամը 11ին, տեւում է 50 րոպե, իսկ հմտությունը՝ քառորդությամբ։

Синтетические записи: голос Sarah, ElevenLabs eleven_v3. Шум добавлен скриптом, исходники и ответы моделей — в репозитории замера.

Ошибочные слова по моделям и уровню шума

Доля ошибочных слов, медиана трёх прогонов
Deepgram Nova-3, hy
Без шума47,7 %
+8 дБ43,2 %
−3 дБ54,5 %
Whisper large-v3 (Groq)
Без шума59,1 %
+8 дБ95,5 %
−3 дБ75,0 %
Whisper large-v3-turbo (Groq)
Без шума63,6 %
+8 дБ54,5 %
−3 дБ77,3 %
Deepgram Nova-3, multi
Без шума111,4 %
+8 дБ127,3 %
−3 дБ100,0 %
Fish Audio transcribe-1
Без шума136,4 %
+8 дБ136,4 %
−3 дБ118,2 %
Deepgram Nova-2
нет армянского
ElevenLabs Scribe v1 ⚠слушает свой же голос — не сравнивать
Без шума2,3 %
+8 дБ2,3 %
−3 дБ2,3 %
Доля ошибочных слов, %

Что видно на карточках

Ошибочные слова (по-английски WER) — доля слов, которые модель заменила, пропустила или дописала, от числа слов эталона. Поэтому больше 100 % тоже бывает.

Ошибаются Whisper и Deepgram по-разному. Whisper large-v3-turbo не теряет ни одного слова, но пишет их с ошибками: «գրաթրանը» вместо «գրադարանը», примерно каждая пятая буква не та. Deepgram Nova-3 пишет слова чище, зато молча выкидывает куски фраз: на чистой записи пропало 12 слов из 44. У обоих часть «ошибок» — числа цифрами («9-ին» вместо «իննին»), смысл при этом верный.

Умеренный шум (+8 дБ) turbo-версии и Nova-3 почти не мешает. При −3 дБ Whisper начинает сочинять слова, Nova-3 теряет меньше, но тоже путает: «ընդմիջումը» (перерыв) превратилось в «հմտությունը» (навык). Полная whisper-large-v3 на записи с +8 дБ во всех трёх прогонах вернула только первое предложение.

Остальные армянского не вывезли: Deepgram Nova-2 армянский не поддерживает — API отклоняет запрос с language=hy (HTTP 400, «нет такой комбинации модель/язык/тир, попробуйте Nova-3»; армянский есть только в списке языков Nova-3). Nova-3 в режиме multi пишет латиницей, Fish Audio — арабским письмом, хотя язык hy ему передавали.

МодельБез шума+8 дБ−3 дБЧем пишет
Deepgram Nova-3, hy47,7 %43,2 %54,5 %армянский
Whisper large-v3 (Groq)59,1 %95,5 %75,0 %армянский
Whisper large-v3-turbo (Groq)63,6 %54,5 %77,3 %армянский
Deepgram Nova-3, multi111,4 %127,3 %100,0 %латиница
Fish Audio transcribe-1136,4 %136,4 %118,2 %арабское письмо
Deepgram Nova-2нет армянскогонет армянскогонет армянского—
ElevenLabs Scribe v1 ⚠2,3 %2,3 %2,3 %армянский

Проще говоря: армянский — сначала вопрос «умеет ли вообще», и только потом «насколько точно». Строку Scribe не сравнивайте с остальными.

Как расшифровать армянское голосовое в боте

В @smolevich_voice_bot два обычных режима. «🚀 Быстрый» стоит по умолчанию — это Whisper large-v3-turbo через Groq, 5 кредитов за минуту. Понять, о чём голосовое, можно, но текст придётся вычитывать. «🎯 Точный» — ElevenLabs Scribe v1, 25 кредитов за минуту; переключается так: «🎤 Расшифровка» → кнопка с текущим режимом → «🎯 Точный». Честной цифры для него на живом армянском у меня нет, так что проверьте на своей записи — бесплатных 200 кредитов в месяц хватит минут на 8. Режим «🪄 Эксклюзивный» — это Fish Audio, для армянского его не берите.

Вопросы

Понимает ли Whisper армянский?

Да, армянский (hy) есть в списке языков Whisper. Но в замере turbo-версия ошиблась в 55–77 % слов.

Почему Deepgram не расшифровывает армянский?

По документации Deepgram армянский есть только у Nova-3, и указать его надо явно (hy). Режим multi армянского не покрывает, Nova-2 — тоже.

Почему 2 % у Scribe — не победа?

Записи озвучены ElevenLabs, и Scribe той же компании узнаёт их слишком хорошо: 2,3 % и без шума, и когда шум громче речи. У честного слушателя так не бывает. Сама ElevenLabs обещает на армянском 5–10 % — но это её оценка, и для более новой Scribe v2.

Как меряли
  • Записи: один армянский текст (4 фразы, 44 слова, про часы работы библиотеки), написан специально для замера. Озвучен в ElevenLabs голосом Sarah, модель eleven_v3, длина 23 с. Из этой записи скриптом сделаны ещё две: белый шум, речь громче шума на 8 дБ; и шум громче речи на 3 дБ, плюс узкий дребезжащий тон. Итого три записи.
  • Модели: Whisper large-v3 и large-v3-turbo через Groq, Deepgram Nova-3 (язык hy и режим multi), Deepgram Nova-2, Fish Audio transcribe-1, ElevenLabs Scribe v1. Язык hy передавали явно всем, кроме Nova-3 multi. В боте язык не передаётся, модель определяет его сама — на этих записях так не прогоняли.
  • Метрика: доля ошибочных слов, WER (word error rate) — сколько слов модель заменила, пропустила или дописала, делённое на число слов эталона. Текст приводится к нижнему регистру, знаки препинания убираются, больше ничего: «9-ին» против «իննին» считается ошибкой. Каждую запись прогоняли 3 раза, в таблице — медиана.
  • Дата: 22 сентября 2026 года.
  • Оговорки: три записи одного текста одним синтетическим голосом — это мало, цифры показывают направление, а не рейтинг. Живая речь с акцентом и уличным шумом может дать другие числа. Scribe слушает голос своей же компании — его строку не сравнивать. Код, записи и ответы моделей — в репозитории stt-benchmarks.