跳到正文
原文
arXiv · Audio and Speech· Qibing Bai, Yuhan Du, Tom Ko, Shuai Wang, Yannan Wang, Haizhou Li·· 16 小时前AI 评分24

DLM-AN:基于离散扩散的可控口音归一化

Controllable Accent Normalization via Discrete Diffusion

AI 导读

DLM-AN 是一个基于自监督语音 token 上掩码离散扩散的可控口音归一化系统,通过 Common Token Predictor 识别并复用可能编码母语发音的源 token 来初始化反向扩散,复用越多保留的原口音越强。

来源:arXiv · Audio and Speech · arxiv.org