arXiv · Audio and Speech· Yangyang Qu, Michele Panariello, Massimiliano Todisco, Nicholas Evans·· 3 小时前AI 评分34
Shared-State Local Translations for Training-Free Voice Conversion
Shared-State Local Translations for Training-Free Voice Conversion
AI 导读
StateVC 提出共享状态机制,在 LibriSpeech 单样本协议下实现 WER 8.01%、CER 3.22%、SIM 0.9512 的转换效果。系统通过高斯混合模型对源与参考语音的 WavLM 帧表示进行聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,在无训练条件下达到最高感知相似度和自然度。
来源:arXiv · Audio and Speech · arxiv.org