Google представи два нови модела за синтез на реч, Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Те позволяват не само преобразуване на текст в реч, но и създаване на собствени гласове с помощта на текстови инструкции, а след това и управление на темпото, интонацията и маниера на изказване на отделните реплики. Моделите са предназначени за разработчици, създатели на съдържание и компании, които се нуждаят от генериране на голям обем аудио.
Gemini 3.8 Flash TTS позволява създаването на гласове от нулата. Потребителят може да опише на естествен език желания глас, неговата роля, акцент и особености на речта. Например да зададе гласа на даден персонаж или регионален начин на произношение. Моделът поддържа над 100 езика и диалекта. Освен това Google предлага библиотека с над 2 000 готови гласа, включително варианти на английски, френски и испански. Компанията възнамерява да добави и възможност за фина настройка на готовите гласове, промяна на тембъра, височината на тона, скоростта на говорене и акцента.
Моделът също така може да възпроизвежда гласа на конкретен човек. За целта е достатъчен 30-секундни аудиозапис на самия потребител или на човек, който е дал разрешение за използване на неговия глас. Google заяви, че преди създаването на копие системата проверява наличието на съгласие, а целият генериран звук се маркира с незабележимия воден знак SynthID.
Двама събеседници
Още една отличителна черта на новите модели е управлението на изпълнението на нивото на отделните реплики. В сценария могат да се добавят инструкции за това как трябва да звучи дадена фраза: да се зададе емоционално състояние, темпо или маниер на говорене, както и да се добавят невербални реакции като смях и въздишки. Моделите са способни да създават диалози с двама събеседници и да запазват характеристиките на гласа през целия период на дългите записи. Това ще бъде полезно за подкасти и аудиокниги.
Gemini 3.8 Flash Lite TTS е предназначена за задачи, при които скоростта и цената на генериране са от значение. Google препоръчва използването на този модел за дублаж, създаване на аудиосъдържание и гласови AI-агенти. Освен това моделът позволява да се контролират тонът, темпото и други характеристики на речта.
Според данни на Google, Gemini 3.8 Flash TTS е получила 71,4 точки в Hume AI Voice Design Benchmark и е показала най-добър резултат в категорията за моделиране на акцент – 60,8 точки. Компанията също така заявява, че и двата нови модела са заели водещи позиции в сляпото потребителско тестване на Voice Arena на няколко езика, включително японски, бразилски португалски, виетнамски, арабски, мексикански испански и хинди.
Gemini 3.8 Flash TTS започва да се разпространява чрез Gemini API и Google AI Studio, а по-късно ще бъде достъпна за предприятия чрез Gemini Enterprise. Flash-Lite също се пуска в API и Google AI Studio и ще се използва в Google Vids. В AI Studio разработчиците могат да създават свои собствени гласове и веднага да ги прилагат в сценарии с няколко говорещи.