Skip to content
Hot eventLive

免训练语音转换新方法 StateVC 发布

2 reports1 sources3 hr ago updated

Get the story

AI overview

2026-10-02,arXiv 发表 Audio and Speech 论文 Shared-State Local Translations for Training-Free Voice Conversion,提出 StateVC。方法通过高斯混合模型对源与参考语音的 WavLM 帧表示聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,实现无训练语音转换。在 LibriSpeech 单样本协议下,WER 8.01%、CER 3.22%、SIM 0.9512,达到最高感知相似度和自然度。同日另一篇 arXiv 论文 FlowW2N 提出基于流匹配的耳语到正常语音转换方法,在 CHAINS 和 wTIMIT 上词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据。

Generated from reports · updated 2 hr ago

Developments

2 developments
  1. Oct 2 · 1 reports
    FlowW2N:基于流匹配的耳语到正常语音转换
    arXiv · Audio and Speech: FlowW2N:基于流匹配的耳语到正常语音转换
  2. Oct 2 · 1 reports
    StateVC:训练免语音转换新方法
    arXiv · Audio and Speech: Shared-State Local Translations for Training-Free Voice Conversion

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Audio and Speech
    FlowW2N:基于流匹配的耳语到正常语音转换

    FlowW2N 提出一种条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,将 CHAINS 和 wTIMIT 上的词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据,在 ASR 嵌入层面验证了跨域不变性。

  2. arXiv · Audio and Speech
    Shared-State Local Translations for Training-Free Voice Conversion

    StateVC 提出共享状态机制,在 LibriSpeech 单样本协议下实现 WER 8.01%、CER 3.22%、SIM 0.9512 的转换效果。系统通过高斯混合模型对源与参考语音的 WavLM 帧表示进行聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,在无训练条件下达到最高感知相似度和自然度。

Heat trend

There is not enough continuous observation data to draw a trend yet.