Пример: одна армянская запись — чисто и под шумом
Записи синтетические: текст озвучен голосом Sarah в ElevenLabs (модель eleven_v3), это не живой человек. Шум наложен скриптом. Ответы моделей — как есть, без правки. Под каждой карточкой — доля ошибочных слов из 44.
- Эталон
- Գրադարանը բացվում է առավոտյան ժամը իննին և փակվում երեկոյան յոթին։ Երկուշաբթի օրը մենք վերադարձնում ենք տասնհինգ գիրք և վերցնում ենք չորս նորը։ Ընթերցասրահում նստած են քսաներկու ուսանողներ, որոնք պատրաստվում են քննություններին։ Դասախոսությունը սկսվում է ժամը տասնմեկին, տևում է հիսուն րոպե, իսկ ընդմիջումը՝ քառորդ ժամ։
- Whisper large-v3-turbo (Groq)ошибочных слов: 63,6 %
- գրաթրանը բացվում է առավոցյան ժամը 9-ին և պակվում երեկոյան 7-ին։ 2-շապցի օրը մենք վերադարցնում ենք 15 գիրկ և վերցնում ենք 4 նորը։ ընդերցասրահում նստած են 22 ու սանողներ, որոնք պատրաստվում են կննություններին։ Դա սախոսությունը նսկսվում է ժամը 11-ին, տեվում է 50-րոպ է, իսկ ընդմիջումը կարորդ ժամ։
- Deepgram Nova-3, язык hyошибочных слов: 47,7 %
- Գրադարանը բացվում է առավոտյան ժամը 9ին 2շապտի օրը մենք վերադարձնում ենք 15 գիրք եւ Ընթերցասրահում նստած ենք 22 ուսանողներ, Դասախոսությունը սկսվում է ժամը 11ին, տեւում է 50 րոպե, իսկ ընդմիջումը՝ քառորդ ժամ,
Та же запись у двух других сервисов: Deepgram Nova-3 в режиме multi — «Gret herene bathsvume ara vodtien jamme innin, yvpackvume yerekoyan yottin…» (111 %), Fish Audio — «گر تهران بادسومه، آرزو تیانجامه…» (арабское письмо, 136 %).
Перевод эталона: «Библиотека открывается в девять утра и закрывается в семь вечера. В понедельник мы возвращаем пятнадцать книг и берём четыре новых. В читальном зале сидят двадцать два студента, которые готовятся к экзаменам. Лекция начинается в одиннадцать, длится пятьдесят минут, а перерыв — четверть часа.»
- Эталон
- тот же текст
- Whisper large-v3-turbo (Groq)ошибочных слов: 54,5 %
- Վրաթրանը բացվում է առավոցյան ժամը 9-ին և պակվում երեկոյան 7-ին։ Վերկու շապթի օրը մենք վերադարցնում ենք 15 գիրկ և վերցնում ենք 4 նորը։ ընդերց ասրահում նստած են 22 ուսանողներ, որոնք պատրաստվում են կննություններին։ Դասախոսությունը նսկսվում է ժամը 11-ին, տեվում է 50 հոպե, իսկ ընդմիջումը կարորդ ժամ։
- Deepgram Nova-3, язык hyошибочных слов: 43,2 %
- Գրադարանը բացվում է առավոտյան ժամը 9ին 2շապտի օրը մենք վերադարձնում ենք 15 գիրք եւ վերցնում ենք 4 նոր Ընթերցասրահում նստած են 22 ուսանողներ, Դասախօսությունը սկսվում է ժամը 11ին, տեւում է 50 րոպե, իսկ ընդմիջումը՝ քառորդ ժամ։
- Эталон
- тот же текст
- Whisper large-v3-turbo (Groq)ошибочных слов: 77,3 %
- Վրաթերանը բատվում է առավոցյան ժամը ինին։ Ես հակվում երեկոյան դյոցն։ Երկուշավցի օրը մենք վերադարդնում ենք 15 դիտ և վերտնում ենք 4 նորը։ ընդհերծասրահում նստաբ ենց շանգերկում իսանողնեք, բորոնք պատրասվում ենք հնություններին։ Շասախոսիթինը նսկսվում է ժամը 11-ին։ տեվում են հիչ ունգոտ է, իսկ ընդնիչումը խարող սմ։
- Deepgram Nova-3, язык hyошибочных слов: 54,5 %
- Գրադարանը բացվում է առավոտյան ժամը 9ին եւ փակում երեկոյան գյուտն է։ Երկուշաբթի օրը մենք վերադարձնում ենք 15ից եւ վերցնում ենք կոշտն օրը։ Ընկերցասրահում նստած են ցանկեեւ ուսանողները, Դասապոչությունը նա սկսվում է ժամը 11ին, տեւում է 50 րոպե, իսկ հմտությունը՝ քառորդությամբ։
Синтетические записи: голос Sarah, ElevenLabs eleven_v3. Шум добавлен скриптом, исходники и ответы моделей — в репозитории замера.
Ошибочные слова по моделям и уровню шума
Что видно на карточках
Ошибочные слова (по-английски WER) — доля слов, которые модель заменила, пропустила или дописала, от числа слов эталона. Поэтому больше 100 % тоже бывает.
Ошибаются Whisper и Deepgram по-разному. Whisper large-v3-turbo не теряет ни одного слова, но пишет их с ошибками: «գրաթրանը» вместо «գրադարանը», примерно каждая пятая буква не та. Deepgram Nova-3 пишет слова чище, зато молча выкидывает куски фраз: на чистой записи пропало 12 слов из 44. У обоих часть «ошибок» — числа цифрами («9-ին» вместо «իննին»), смысл при этом верный.
Умеренный шум (+8 дБ) turbo-версии и Nova-3 почти не мешает. При −3 дБ Whisper начинает сочинять слова, Nova-3 теряет меньше, но тоже путает: «ընդմիջումը» (перерыв) превратилось в «հմտությունը» (навык). Полная whisper-large-v3 на записи с +8 дБ во всех трёх прогонах вернула только первое предложение.
Остальные армянского не вывезли: Deepgram Nova-2 армянский не поддерживает — API отклоняет запрос с language=hy (HTTP 400, «нет такой комбинации модель/язык/тир, попробуйте Nova-3»; армянский есть только в списке языков Nova-3). Nova-3 в режиме multi пишет латиницей, Fish Audio — арабским письмом, хотя язык hy ему передавали.
| Модель | Без шума | +8 дБ | −3 дБ | Чем пишет |
|---|---|---|---|---|
| Deepgram Nova-3, hy | 47,7 % | 43,2 % | 54,5 % | армянский |
| Whisper large-v3 (Groq) | 59,1 % | 95,5 % | 75,0 % | армянский |
| Whisper large-v3-turbo (Groq) | 63,6 % | 54,5 % | 77,3 % | армянский |
| Deepgram Nova-3, multi | 111,4 % | 127,3 % | 100,0 % | латиница |
| Fish Audio transcribe-1 | 136,4 % | 136,4 % | 118,2 % | арабское письмо |
| Deepgram Nova-2 | нет армянского | нет армянского | нет армянского | — |
| ElevenLabs Scribe v1 ⚠ | 2,3 % | 2,3 % | 2,3 % | армянский |
Проще говоря: армянский — сначала вопрос «умеет ли вообще», и только потом «насколько точно». Строку Scribe не сравнивайте с остальными.
Как расшифровать армянское голосовое в боте
В @smolevich_voice_bot два обычных режима. «🚀 Быстрый» стоит по умолчанию — это Whisper large-v3-turbo через Groq, 5 кредитов за минуту. Понять, о чём голосовое, можно, но текст придётся вычитывать. «🎯 Точный» — ElevenLabs Scribe v1, 25 кредитов за минуту; переключается так: «🎤 Расшифровка» → кнопка с текущим режимом → «🎯 Точный». Честной цифры для него на живом армянском у меня нет, так что проверьте на своей записи — бесплатных 200 кредитов в месяц хватит минут на 8. Режим «🪄 Эксклюзивный» — это Fish Audio, для армянского его не берите.
Вопросы
Понимает ли Whisper армянский?
Да, армянский (hy) есть в списке языков Whisper. Но в замере turbo-версия ошиблась в 55–77 % слов.
Почему Deepgram не расшифровывает армянский?
По документации Deepgram армянский есть только у Nova-3, и указать его надо явно (hy). Режим multi армянского не покрывает, Nova-2 — тоже.
Почему 2 % у Scribe — не победа?
Записи озвучены ElevenLabs, и Scribe той же компании узнаёт их слишком хорошо: 2,3 % и без шума, и когда шум громче речи. У честного слушателя так не бывает. Сама ElevenLabs обещает на армянском 5–10 % — но это её оценка, и для более новой Scribe v2.
Как меряли
- Записи: один армянский текст (4 фразы, 44 слова, про часы работы библиотеки), написан специально для замера. Озвучен в ElevenLabs голосом Sarah, модель
eleven_v3, длина 23 с. Из этой записи скриптом сделаны ещё две: белый шум, речь громче шума на 8 дБ; и шум громче речи на 3 дБ, плюс узкий дребезжащий тон. Итого три записи. - Модели: Whisper large-v3 и large-v3-turbo через Groq, Deepgram Nova-3 (язык
hyи режимmulti), Deepgram Nova-2, Fish Audiotranscribe-1, ElevenLabs Scribe v1. Языкhyпередавали явно всем, кроме Nova-3multi. В боте язык не передаётся, модель определяет его сама — на этих записях так не прогоняли. - Метрика: доля ошибочных слов, WER (word error rate) — сколько слов модель заменила, пропустила или дописала, делённое на число слов эталона. Текст приводится к нижнему регистру, знаки препинания убираются, больше ничего: «9-ին» против «իննին» считается ошибкой. Каждую запись прогоняли 3 раза, в таблице — медиана.
- Дата: 22 сентября 2026 года.
- Оговорки: три записи одного текста одним синтетическим голосом — это мало, цифры показывают направление, а не рейтинг. Живая речь с акцентом и уличным шумом может дать другие числа. Scribe слушает голос своей же компании — его строку не сравнивать. Код, записи и ответы моделей — в репозитории stt-benchmarks.