Skip to content
Hot eventLive

DEFINE:基于示例引导的零样本 TTS 口音控制方法

2 reports1 sources5 hr ago updated

Get the story

AI overview

DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。

Generated from reports · updated 4 hr ago

Developments

2 developments
  1. Oct 2 · 1 reports
    DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
    arXiv · Audio and Speech: DEFINE:基于示例引导的零样本 TTS 口音控制方法
  2. Oct 2 · 1 reports
    发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成
    arXiv · Audio and Speech: 发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Audio and Speech
    发音源-滤波器 TTS:通过声道运动学实现基于物理的可控语音合成

    该研究提出一种基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成伪运动学轨迹,分别预测基频与能量轮廓并参数化声门源,源与滤波器独立预测后经 OT-CFM 模块优化再重组为频谱。在保持与同等规模基线相当的可懂度与自然度的同时,实现了清晰的源-滤波器解耦,支持稳定的韵律缩放与跨说话者源/滤波器重组,以及通过直接操控发音轨迹实现口音修改等细粒度控制。

  2. arXiv · Audio and Speech
    DEFINE:基于示例引导的零样本 TTS 口音控制方法

    DEFINE 是一个基于 F5-TTS 与参数高效 LoRA 微调的端到端零样本 TTS 框架,通过分离说话人身份与目标口音的音频示例实现口音控制。单个推理权重可连续调节口音强度,无需口音标签或后合成波形转换。在已见口音上,口音探针准确率从 6.5% 提升至 19.6%;单一模型在已见和域外口音上达到与双模型 TTS-变声级联相当的口音迁移效果,同时保持更高说话人相似度和可比语音质量。

Heat trend

Current heat 9·Comparable peak 10(Oct 2)·Comparable change over 24 hours –

02.557.510Oct2Oct2Oct2Oct2

The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.