跳到正文
原文
arXiv · Audio and Speech· Nahomi Kusunoki, Tsubasa Ochiai, Naohiro Tawara, Marc Delcroix, Naoyuki Kamo, Tetsuji Ogawa, Shoko Araki·· 3 小时前AI 评分35

预测 MOS 在复现语音增强系统级人类偏好时有多可靠?

How Reliable Are Predicted MOS for Reproducing Human System-Level Preferences in Speech Enhancement?

AI 导读

论文提出系统级偏好准确率(SPA)评估预测 MOS 与人类判断在语音增强系统比较中的一致性。单模型 SPA 为 9.4%–76.8%,最优模型仍有约 23% 系统比较与人类判断不一致;集成仅带来有限提升,域适应在封闭条件下显著改善 SPA,但在开放条件下增益有限。

来源:arXiv · Audio and Speech · arxiv.org