Xiaomi обяви, че нейният екип Kaldi от лабораторията AI Lab е публикувал изходния код на нов модел за синтез на реч (TTS), наречен OmniVoice. Според компанията моделът е предназначен за висококачествен синтез на реч на стотици езици, както и поддържа клониране на глас и персонализирано генериране на реч.

Анонсът беше публикуван чрез официалния акаунт на Xiaomi в WeChat, където компанията заяви, че OmniVoice демонстрира висока производителност както на китайски, така и на английски език, конкурирайки се със съществуващите търговски системи, а в някои многоезични задачи дори ги превъзхожда.

Една от основните характеристики на OmniVoice е поддръжката на езици с ограничени ресурси. Xiaomi твърди, че моделът може да генерира реч на „практически всеки възможен език“, включително езици с много ограничено количество обучителни данни в интернет. Компанията описва OmniVoice като първия в бранша TTS-модел за клониране на глас, обхващащ стотици езици.

В многоезичните тестове OmniVoice надмина няколко търговски системи в 24 езика по показатели за сходство на речта и разбираемост, дори при обучение само на набори от данни с отворен код. Компанията също така твърди, че в тестове на 102 езика разбираемостта на речта на OmniVoice е била близка до човешката реч, а в някои случаи я е надминавала.

Моделът е разработен и за работа с ограничен обем обучителни данни. Според производителя дори езици с по-малко от 10 часа обучителен материал могат да постигнат високо качество на синтеза на реч, което може да спомогне за разширяване на поддръжката на речевите технологии за малки регионални и нишови езици.

Xiaomi също така съобщава, че OmniVoice използва много по-опростена архитектура в сравнение с много от съвременните системи за синтез на реч. Вместо да използва няколко различни модула и етапа на прогнозиране, моделът прилага единна двупосочна мрежа Transformer за директно преобразуване на текст в реч. Това елиминира необходимостта от отделно моделиране на текст, сложни хибридни структури и многостепенни системи за прогнозиране на токени, които обикновено се срещат в съвременните TTS-модели.

Опростената конструкция повишава скоростта: Xiaomi твърди, че OmniVoice завършва обучението си на 100 000 часа данни за един ден. По време на извеждането моделът може да работи със скорост до 40 пъти по-бързо от реалното време с използване на PyTorch, което може да улесни внедряването му в потребителски приложения и услуги. Според Xiaomi две основни конструктивни решения са помогнали за подобряване на производителността на модела:

Първото е „стратегията за пълно случайно маскиране на кодовата книга“, която, както се съобщава, повишава ефективността на обучението и общата производителност на модела. Второ – използването на голям езиков модел по време на предварителното обучение. Xiaomi твърди, че това е първият случай, в който голям езиков модел е бил ефективно интегриран в неавторегресивен TTS-модел с цел подобряване на точността на произношението и разбираемостта на речта.

Наред с многоезичното генериране на реч, OmniVoice включва няколко практични функции. Потребителите могат да създават свои собствени гласове, като просто опишат характеристики като възраст, пол, височина на тона, акцент, диалект или стил на говорене. Моделът също така може да генерира шепот и други специални стилове на говорене, без да е необходим еталонна аудио проба.

Друга функция е насочена към работа с шумови аудио среди. Xiaomi твърди, че OmniVoice може автоматично да премахва фоновия шум от еталонните записи и да извлича по-ясни гласови характеристики, което позволява да се постигне по-качествено клониране на гласа дори при запис на изходния аудио файл в неидеални условия.

Моделът също така поддържа изразителен синтез на речта чрез управление на интонацията, включително ефекти на смях и въздишки, което прави генерираните гласове по-естествени и разговорни.
За точност на произношението OmniVoice включва инструменти, позволяващи на потребителите ръчно да коригират сложни произношения, включително многозначни китайски йероглифи и английски собствени имена. Xiaomi твърди, че това може да повиши надеждността на синтезираната реч в реални приложения

Github | Демо | Huggingface