arXiv · Audio and Speech· Fabian Ritter-Gutierrez, Md Asif Jalal, Pablo Peso Parada, Karthikeyan Saravanan, Yusun Shul, Minseung Kim, Gun-Woo Lee, Han-Gil Moon·· 3 小时前AI 评分28
FlowW2N:基于流匹配的耳语到正常语音转换
FlowW2N: Whispered-to-Normal Speech Conversion via Flow-Matching
AI 导读
FlowW2N 提出一种条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,将 CHAINS 和 wTIMIT 上的词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据,在 ASR 嵌入层面验证了跨域不变性。
来源:arXiv · Audio and Speech · arxiv.org