Синтез мовлення за допомогою нейронних моделей

Субота, 04 грудня 2021, 02:41

Нейронні моделі синтезу мовлення (TTS) успішно використовуються для створення високоякісної імітації людського мовлення. Однак більшість моделей TTS може використовуватися за умови наявних записаних даних потрібного мовця. Це означає, що довгі нерозшифровані дані, такі як подкасти, не можна використовувати для використання чинних моделей.

Про це пише сайт новин Волині Конкурент з посиланням на Technology.org.

Генеративна модель на основі дифузії тестується на не транскрибованих даних, які використовують класифікатор фонем для синтезу тексту в мовлення.

Результати показують, що запропонований метод відповідає продуктивності чинних моделей на LJSpeech.  Завдяки використанню класифікатора на наборі даних із кількома динаміками, порівнянна продуктивність зображається без перегляду будь-якої стенограми LJSpeech.  Тому можна побудувати якісну модель TTS без розшифровки для потрібного динаміка.

Guided-TTS досягає порівнянної продуктивності з чинними методами без будь-якої транскрипту для LJSpeech.  Результати також показують, що один залежний від мовця класифікатор фонем, навчений на великомасштабних даних з багатьма динаміками, може керувати безумовними DDPM для різних мовців для виконання TTS.

ЧИТАЙТЕ ТАКОЖ: