热点事件持续更新
DEFINE:基于示例引导的零样本 TTS 口音控制方法
2 篇报道1 个报道来源4 小时前 更新
先了解这件事
AI 综述
DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。
AI 根据报道生成 · 3 小时前更新
事件进展
2 个进展
- 10月2日 12:00 · 1 篇报道DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTSarXiv · Audio and Speech:DEFINE:基于示例引导的零样本 TTS 口音控制方法
- 10月2日 12:00 · 1 篇报道发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成arXiv · Audio and Speech:发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · Audio and Speech发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成
该研究提出一种基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成伪运动学轨迹,分别预测基频与能量轮廓并参数化声门源,源与滤波器独立预测后经 OT-CFM 模块优化再重组为频谱。在保持与同等规模基线相当的可懂度与自然度的同时,实现了清晰的源-滤波器解耦,支持稳定的韵律缩放与跨说话者源/滤波器重组,以及通过直接操控发音轨迹实现口音修改等细粒度控制。
- arXiv · Audio and SpeechDEFINE:基于示例引导的零样本 TTS 口音控制方法
DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。
本事件热度走势
当前热度 9·可比范围峰值 10(10月2日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。