arXiv · Audio and Speech· Mingyue Huo, Shivam Mehta, Bhavin Jawade, Yinghong Lan, Haoqi Li·· 6 小时前精选AI 评分60
语音LLM评测中的声学捷径与欠明确理由研究
Louder, Longer, Livelier: Acoustic Shortcuts and Underspecified Rationales in Speech LLM Judges
AI 导读
论文审计了六款语音LLM评测模型,发现它们一致地偏好更响亮的音频、更重视内容丰富度,并将情感表达映射为质量偏好;这些效应在成对比较中更明显,而逐分评分常将其掩盖。伴随的理由很少指出改变判断的声学线索,词汇有限,导致声学依据不明确。作者发布SpeechJudgeAudit数据集与工具以支持复现和后续审计。
推荐理由
研究揭示了语音大模型在评估中的声学捷径问题,对构建更可靠的语音评测系统有参考价值。
来源:arXiv · Audio and Speech · arxiv.org