Skip to content
arXiv · Audio and Speech· Hounsu Kim, Joonyong Park, Yuki Saito, Satoru Fukayama, Juhan Nam·· 4 hr agoAI score21

零样本文本转语音中掩码替换扩散机制的探究

Beyond Token Revision: Investigating Mask-and-Replace Diffusion for Zero-Shot Text-to-Speech

AI brief

论文提出 DeMaR,将掩码替换训练与置信度排序的纯掩码采样结合,在保持总训练损坏概率不变的前提下,于 LibriTTS 上从零训练,在相同语音 tokenizer 下取得比自回归与纯掩码扩散基线更低的词错误率(WER)。

Source: arXiv · Audio and Speech · arxiv.org