跳到正文
热点事件持续更新

免训练语音转换新方法 StateVC 发布

2 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026-10-02,arXiv 发表 Audio and Speech 论文 Shared-State Local Translations for Training-Free Voice Conversion,提出 StateVC。方法通过高斯混合模型对源与参考语音的 WavLM 帧表示聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,实现无训练语音转换。在 LibriSpeech 单样本协议下,WER 8.01%、CER 3.22%、SIM 0.9512,达到最高感知相似度和自然度。同日另一篇 arXiv 论文 FlowW2N 提出基于流匹配的耳语到正常语音转换方法,在 CHAINS 和 wTIMIT 上词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月2日 12:00 · 1 篇报道
    FlowW2N:基于流匹配的耳语到正常语音转换
    arXiv · Audio and Speech:FlowW2N:基于流匹配的耳语到正常语音转换
  2. 10月2日 12:00 · 1 篇报道
    StateVC:训练免语音转换新方法
    arXiv · Audio and Speech:Shared-State Local Translations for Training-Free Voice Conversion

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Audio and Speech
    FlowW2N:基于流匹配的耳语到正常语音转换

    FlowW2N 提出一种条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,将 CHAINS 和 wTIMIT 上的词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据,在 ASR 嵌入层面验证了跨域不变性。

  2. arXiv · Audio and Speech
    Shared-State Local Translations for Training-Free Voice Conversion

    StateVC 提出共享状态机制,在 LibriSpeech 单样本协议下实现 WER 8.01%、CER 3.22%、SIM 0.9512 的转换效果。系统通过高斯混合模型对源与参考语音的 WavLM 帧表示进行聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,在无训练条件下达到最高感知相似度和自然度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。