跳到正文
原文
arXiv · Audio and Speech· Mahdi Amiri, Hatef Otroshi Shahreza, Pascal Frossard, Ina Kodrasi·· 16 小时前AI 评分26

用低层声学特征增强大型音频语言模型以检测构音障碍语音

Augmenting Large Audio Language Models with Low-Level Acoustic Features for Dysarthric Speech Detection

AI 导读

研究提出一个框架,将语音录音与低层声学特征、说话者人口统计信息结合,对大型音频语言模型(LALMs)进行微调,用于构音障碍语音检测。在两个 LALMs 上,该框架优于深度学习基线,其中 Qwen2-Audio-Instruct 取得 SOTA 表现。消融实验显示加入声学特征与人口统计信息可提升性能,而 LALMs 单独零样本表现仅达随机水平。

来源:arXiv · Audio and Speech · arxiv.org