跳到正文
原文
arXiv · Audio and Speech· Lucas H. Ueda, Jo\~ao G. T. Lima, Pedro R. Corr\^ea, Fl\'avio O. Sim\~oes, M\'ario U. Neto, Paula D. P. Costa·· 3 小时前AI 评分22

SelfTTS:通过显式嵌入解耦与自精炼实现跨说话人风格迁移的文本转语音模型

SelfTTS: cross-speaker style transfer through explicit embedding disentanglement and self-refinement using self-augmentation

AI 导读

SelfTTS 是一种无需外部预训练说话人或情感编码器的文本转语音模型,通过梯度反转层与余弦相似度损失解耦说话人和情感信息,并引入多正对比学习(MPCL)实现嵌入聚类。模型利用自增强策略结合声音转换能力提升合成语音的自然度,在情感自然度(eMOS)和目标音色/情感稳定性上优于现有基线。

来源:arXiv · Audio and Speech · arxiv.org