免训练语音转换新方法 StateVC 发布
Get the story
2026-10-02,arXiv 发表 Audio and Speech 论文 Shared-State Local Translations for Training-Free Voice Conversion,提出 StateVC。方法通过高斯混合模型对源与参考语音的 WavLM 帧表示聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,实现无训练语音转换。在 LibriSpeech 单样本协议下,WER 8.01%、CER 3.22%、SIM 0.9512,达到最高感知相似度和自然度。同日另一篇 arXiv 论文 FlowW2N 提出基于流匹配的耳语到正常语音转换方法,在 CHAINS 和 wTIMIT 上词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据。
Generated from reports · updated 2 hr ago
Developments
- Oct 2 · 1 reportsFlowW2N:基于流匹配的耳语到正常语音转换arXiv · Audio and Speech: FlowW2N:基于流匹配的耳语到正常语音转换
- Oct 2 · 1 reportsStateVC:训练免语音转换新方法arXiv · Audio and Speech: Shared-State Local Translations for Training-Free Voice Conversion
Timeline
Follow the coverage from different angles.
- arXiv · Audio and SpeechFlowW2N:基于流匹配的耳语到正常语音转换
FlowW2N 提出一种条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,将 CHAINS 和 wTIMIT 上的词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据,在 ASR 嵌入层面验证了跨域不变性。
- arXiv · Audio and SpeechShared-State Local Translations for Training-Free Voice Conversion
StateVC 提出共享状态机制,在 LibriSpeech 单样本协议下实现 WER 8.01%、CER 3.22%、SIM 0.9512 的转换效果。系统通过高斯混合模型对源与参考语音的 WavLM 帧表示进行聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,在无训练条件下达到最高感知相似度和自然度。
Heat trend
There is not enough continuous observation data to draw a trend yet.