跳到正文
原文
arXiv · Audio and Speech· Fabian Ritter-Gutierrez, Md Asif Jalal, Pablo Peso Parada, Karthikeyan Saravanan, Yusun Shul, Minseung Kim, Gun-Woo Lee, Han-Gil Moon·· 3 小时前AI 评分28

FlowW2N:基于流匹配的耳语到正常语音转换

FlowW2N: Whispered-to-Normal Speech Conversion via Flow-Matching

AI 导读

FlowW2N 提出一种条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,将 CHAINS 和 wTIMIT 上的词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据,在 ASR 嵌入层面验证了跨域不变性。

来源:arXiv · Audio and Speech · arxiv.org