Amazon обявиха, че са създали нова AI система, която може да обучи дигитални системи, подобни на Alexa, да заучават нови говорни стилове, и то за броени часове. Според завеждащия отдела по приложни науки към Amazon Тревър Ууд, новата система може да замени с лекота традиционния сега начин за обучение на гласовите асистенти, при който актьори говорят с часове в конкретен стил (като да речем на говорител в новинарска емисия), за да обучи дигиталния асистент.

„За потребителите, синтетичната реч, възпроизвеждана от невронните мрежи звучи много по-естествено, отколкото речта, постигана чрез конкатенативните методи, при които отделни кратки речеви отрязъци от аудио база данни биват обединявани един с други“, обяснява Ууд.

Amazon, които назовават новия метод „невронно предаване на текст към реч“ (neural text-to-speech) или NTTS, споделят, че два ключови компонента са определящи тук. Първият е генеративна невронна мрежа, която конвертира поредица от фонеми в поредица от спектограми, които на свой ред представляват визуално изображение на спектъра на честотите на тези звуци, тъй като те се променят във времето. Самите спектограми подчертават характеристики, които човешкият мозък използва при обработката на реч. Другият компонент, изтъква Ууд, се нарича вокодер, който помага за обръщането на тези спектограми в непрекъснат аудио сигнал, използван за обучение в „текст към реч“ модела.

От компанията са провели и демонстрация пред публика, която е изразила ясно предпочитанието си за NTTS пред традиционния метод, като част от хората са го поставили почти наравно с човешки четец на новини.