跳到正文
热点事件持续更新

DEFINE:基于示例引导的零样本 TTS 口音控制方法

2 篇报道1 个报道来源4 小时前 更新

先了解这件事

AI 综述

DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。

AI 根据报道生成 · 3 小时前更新

事件进展

2 个进展
  1. 10月2日 12:00 · 1 篇报道
    DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
    arXiv · Audio and Speech:DEFINE:基于示例引导的零样本 TTS 口音控制方法
  2. 10月2日 12:00 · 1 篇报道
    发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成
    arXiv · Audio and Speech:发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Audio and Speech
    发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成

    该研究提出一种基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成伪运动学轨迹,分别预测基频与能量轮廓并参数化声门源,源与滤波器独立预测后经 OT-CFM 模块优化再重组为频谱。在保持与同等规模基线相当的可懂度与自然度的同时,实现了清晰的源-滤波器解耦,支持稳定的韵律缩放与跨说话者源/滤波器重组,以及通过直接操控发音轨迹实现口音修改等细粒度控制。

  2. arXiv · Audio and Speech
    DEFINE:基于示例引导的零样本 TTS 口音控制方法

    DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。

本事件热度走势

当前热度 9·可比范围峰值 10(10月2日 13:00)·近 24 小时可比范围变化 –

02.557.51010月2日13:0010月2日14:0010月2日14:0010月2日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。