arXiv · Audio and Speech· Lijun Wang, Yixian Lu, Shogo Okada·· 3 小时前AI 评分26
MGSA:单调性引导语义对齐的零样本多说话人图像转语音合成框架
Monotonicity-Guided Semantic Alignment for Zero-shot Multispeaker Image-to-Speech Synthesis
AI 导读
MGSA 提出单调性引导语义对齐方法,实现零样本多说话人图像转语音合成,使用语义语音单元作为跨说话人共享内容目标,并通过软单调先验将视觉语义记忆映射到语音单元位置。实验在 Flickr8k-Audio 上达到与单说话人基线相当的描述性能,LibriTTS-R 参考验证支持未见说话人的零样本合成。音频示例已发布于论文链接。
来源:arXiv · Audio and Speech · arxiv.org