跳到正文
原文
arXiv · Audio and Speech· Jesuraj Bandekar, Shinji Watanabe, Prasanta Kumar Ghosh·· 5 小时前AI 评分38

发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成

Articulatory Source-Filter TTS: Physically Grounded Control through Vocal Tract Kinematics

AI 导读

该研究提出一种基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成伪运动学轨迹,分别预测基频与能量轮廓并参数化声门源,源与滤波器独立预测后经 OT-CFM 模块优化再重组为频谱。在保持与同等规模基线相当的可懂度与自然度的同时,实现了清晰的源-滤波器解耦,支持稳定的韵律缩放与跨说话者源/滤波器重组,以及通过直接操控发音轨迹实现口音修改等细粒度控制。

来源:arXiv · Audio and Speech · arxiv.org