Послушайте: один текст, четыре записи
- Текст
- «Привет! [laughs] Ты серьёзно? [whispers] Я расскажу тебе секрет.»
- Что прозвучало
- «Привет, Левс. Ты серьезно? Висперс, я расскажу…»
- Текст
- «Привет! [laughs] Ты серьёзно? [whispers] Я расскажу тебе секрет.»
- Что прозвучало
- «Привет. Ты серьёзно? Я расскажу тебе секрет.»
- Текст
- «Привет! [смеётся] Ты серьёзно? [шёпотом] Я расскажу тебе секрет.»
- Что прозвучало
- «— Привет. — Ты серьёзно? — Я расскажу тебе секрет.»
- Текст
- «Привет! Ты серьёзно? Я расскажу тебе секрет.»
- Что прозвучало
- «Привет. Ты серьёзно? Я расскажу тебе секрет.»
Короткий ответ: в нашем замере модель Multilingual v2 читает теги вслух как обычные слова — [laughs] звучит как «Левс», [whispers] как «Висперс». Модель v3 теги не произносит ни по-английски, ни по-русски, но засмеялась ли она и перешла ли на шёпот, расшифровка не показывает — это слышно только в плеерах выше.
Что стало с тегом
| Модель | Теги | Что стало с тегом | Списано символов |
|---|---|---|---|
| Multilingual v2 | английские | прочитан вслух словом | 64 |
| v3 | английские | в расшифровке его нет | 64 |
| v3 | русские | в расшифровке его нет | не записали |
| v3 | без тегов | — | 44 |
Как мы это поняли
Мы хотели добавить в бота смех и шёпот и сначала проверили, слушает ли модель теги вообще. На слух такие вещи легко додумать, поэтому каждую запись прогнали обратно через распознавание речи: если тег проговорён словами, он всплывёт в тексте. На v2 всплыл — «Левс» и «Висперс» прямо посреди фразы.
На v3 слов из скобок в расшифровке нет, причём и для [laughs], и для [смеётся]. Значит теги можно писать по-русски, хотя бы в том смысле, что голос их не зачитает. Зато записи с тегами заметно длиннее, чем без них: 3,9 и 5,6 секунды против 3,0. Что заполнило эти секунды — смешок, пауза или что-то ещё — по тексту не определить, честно, это надо слушать.
Скобки при этом платные: один и тот же текст с тегами списал 64 символа и на v2, и на v3, без тегов — 44. То есть на v2 вы платите за то, чтобы услышать «Левс».
Что говорит сама ElevenLabs: в документации по написанию текста аудиотеги вроде [laughs] и [whispers] описаны для v4, и там сказано, что те же приёмы, включая теги, подходят для v3. Там же предупреждение: тег срабатывает охотнее, если голос уже умеет так звучать, и свой голос стоит проверять самому. На странице моделей у Multilingual v2 теги среди возможностей не указаны. Сейчас ElevenLabs называет v3 моделью прошлого поколения и советует v4 — её мы не проверяли.
В общем, если в озвучке вдруг прозвучало «Левс» — дело не в теге, а в модели
Вопросы
Почему ElevenLabs читает теги вслух?
В нашем замере так делала модель Multilingual v2: квадратные скобки для неё обычный текст. На v3 тот же текст прозвучал без слов из скобок.
Можно ли писать теги эмоций на русском в v3?
[смеётся] и [шёпотом] v3 вслух не произнесла. Отыгрывает ли она по ним эмоцию, наша расшифровка не различает — послушайте третью запись.
Работают ли теги в боте @smolevich_voice_bot?
Пока нет. Студийный голос для русского текста озвучивает Multilingual v2, а текст уходит в неё как есть, так что [laughs] прозвучит словом. Теги в скобках в боте лучше не писать.
Как проверяли
- Дата: 18 августа 2026 года.
- Модели:
eleven_multilingual_v2иeleven_v3, обычный запрос к API озвучки ElevenLabs, одинаковые настройки голоса. - Голос: Vasiliy (
1REYVgkHGlaFX4Rz9cPZ). - Тексты: «Привет! [laughs] Ты серьёзно? [whispers] Я расскажу тебе секрет.» — на v2 и v3; «Привет! [смеётся] Ты серьёзно? [шёпотом] Я расскажу тебе секрет.» — на v3; тот же текст без тегов — на v3. Русские теги на v2 не проверяли.
- Как сверяли: обратная расшифровка каждой записи, длительность файла, число списанных символов из ответа ElevenLabs.
- Оговорка: это 4 записи, один голос, одна фраза и по одному запуску на вариант. Для «модель так делает всегда» этого мало, для «вот что получилось у нас» — достаточно.