arXiv · Audio and Speech· Mu-Ruei Tseng, Waris Quamer, Ghady Nasrallah, Ricardo Gutierrez-Osuna·· 3 小时前AI 评分28
VOSSA:流式语音架构的声纹优化
VOSSA: Voiceprint Optimization for Streaming Speech Architectures
AI 导读
VOSSA 提出一种声纹优化框架,从中间内容编码器层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善 F0 动态与元音区分声学线索,NISQA-MOS、WER 和说话人相似度保持可比;感知测试显示自然度、说话人相似度、可懂度和表现力提升。
来源:arXiv · Audio and Speech · arxiv.org