跳到正文
原文
arXiv · Audio and Speech· Ambuj Mehrish, Abhinaba Roy, Alex Ivanov, Tawsif Ahmed, Dorien Herremans·· 5 小时前AI 评分39

DEFINE:基于示例引导的零样本 TTS 口音控制方法

DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS

AI 导读

DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。

来源:arXiv · Audio and Speech · arxiv.org