跳到正文
原文
arXiv · Audio and Speech· Massa Baali, Sarthak Bisht, Ziyue Qiu, Joseph Konan, Rita Singh, Bhiksha Raj·· 16 小时前AI 评分36

CoLMbo-SV:可解释说话人验证的接地语言模型

CoLMbo-SV: A Grounded Language Model for Explainable Speaker Verification

AI 导读

CoLMbo-SV 将预训练说话人编码器接入语言模型并输入显式声学测量,在生成结构化声学比较报告的同时保持强说话人判别能力。配套数据集 VoxReason 提供带实测声学属性与比较报告的配对录音;在 VoxCeleb1-O 上取得 0.99% EER,相对最强音频语言基线降低约 80% 验证错误,数值接地得分 0.82。

来源:arXiv · Audio and Speech · arxiv.org