ElevenLabs представи два нови модела за синтез на реч, Eleven v4 и Eleven v4 Turbo. Те предлагат по-прецизен контрол върху интонацията и емоционалното предаване, поддръжка над 90 езика и по-малко закъснение при работата на гласовите AI-агенти. Eleven v4 е насочена към максимално изразителна реч, а Turbo е подходяща за използване в режим на реално време.

Eleven v4 вече отчита по-внимателно контекста при озвучаването, може да променя темпото, интонацията и емоционалното представяне в зависимост от ситуацията, като същевременно запазва гласа на говорещия. Моделът също така работи по-добре с дълги фрагменти и диалози с няколко персонажа, което е актуално за аудиокнигите.

В предишната версия ElevenLabs добави тагове за управление на изразителността на речта, които позволяват вмъкването на указания на естествен език, като например „[смее се]“ или „[шепне]“. Във v4 системата започна по-добре да отчита последователността на такива сценарии и да комбинира няколко тага при генерирането на реч. Компанията също така твърди, че новият модел запазва по-надеждно характеристиките на гласа в продължение на дълги текстови фрагменти.

Поддържа се и българския език

Броят на поддържаните езици се е увеличил от 70 в Eleven v3 до над 90 в новото поколение. От компанията отбелязват особено забележимо подобрение в качеството за японски, бразилски португалски, мандарински и кантонски китайски. Сред поддържаните езици са също български, руски, украински, полски, литовски и други езици.

Същевременно ElevenLabs опрости клонирането на гласове. За функцията за мигновено клониране са достатъчни 10 секунди аудиозапис.

Eleven v4 Turbo е предназначена преди всичко за гласови агенти и други приложения, при които скоростта на отговор е от съществено значение. В собствените тестове на ElevenLabs средното време до първия фрагмент от речта при v4 Turbo е 150 ms, срещу 262 ms при Cartesia Sonic 3.6 и 814 ms при OpenAI GPT-4o mini TTS. Моделът може да започне да генерира аудио още преди езиковият модел да е оформил напълно отговора, което позволява диалогът с гласовия агент да бъде по-плавен. Освен това моделът се справя по-добре с конфликтни ситуации по време на разговори, което е особено важно за корпоративните кол-центрове.