热点事件持续更新
免训练语音转换新方法 StateVC 发布
2 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026-10-02,arXiv 发表 Audio and Speech 论文 Shared-State Local Translations for Training-Free Voice Conversion,提出 StateVC。方法通过高斯混合模型对源与参考语音的 WavLM 帧表示聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,实现无训练语音转换。在 LibriSpeech 单样本协议下,WER 8.01%、CER 3.22%、SIM 0.9512,达到最高感知相似度和自然度。同日另一篇 arXiv 论文 FlowW2N 提出基于流匹配的耳语到正常语音转换方法,在 CHAINS 和 wTIMIT 上词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据。
AI 根据报道生成 · 1 小时前更新
事件进展
2 个进展
- 10月2日 12:00 · 1 篇报道FlowW2N:基于流匹配的耳语到正常语音转换arXiv · Audio and Speech:FlowW2N:基于流匹配的耳语到正常语音转换
- 10月2日 12:00 · 1 篇报道StateVC:训练免语音转换新方法arXiv · Audio and Speech:Shared-State Local Translations for Training-Free Voice Conversion
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · Audio and SpeechFlowW2N:基于流匹配的耳语到正常语音转换
FlowW2N 提出一种条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,将 CHAINS 和 wTIMIT 上的词错误率相对降低 26-46%,推理仅需 10 步,无需真实配对数据,在 ASR 嵌入层面验证了跨域不变性。
- arXiv · Audio and SpeechShared-State Local Translations for Training-Free Voice Conversion
StateVC 提出共享状态机制,在 LibriSpeech 单样本协议下实现 WER 8.01%、CER 3.22%、SIM 0.9512 的转换效果。系统通过高斯混合模型对源与参考语音的 WavLM 帧表示进行聚类,在每个状态内估计均值偏移并按帧后验概率组合更新,在无训练条件下达到最高感知相似度和自然度。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。