跳到正文
原文
arXiv · Audio and Speech· Shuubham Ojha, Carol Espy-Wilson·· 5 小时前AI 评分25

无教师自蒸馏一致性轨迹学习实现快速语音增强

Teacher-Free Self-Distilled Consistency Trajectory Learning for Fast Speech Enhancement

AI 导读

本文提出无教师自蒸馏一致性轨迹框架,去除外部教师模型,每轮训练时间减少 5 倍。模型采用三阶段课程训练,在 VoiceBank+DEMAND 上达到宽带 PESQ 3.01、ESTOI 0.87、SI-SDR 19.07 dB,优于基于教师模型的 3.57、0.87 和 12.8 dB。研究发现低步数几何调度最大化感知质量,高步数均匀调度有利于信号保真度。

来源:arXiv · Audio and Speech · arxiv.org