arXiv · Information Retrieval· Kun Fang, Ziyu Wang, Ichiro Fujinaga·· 16 小时前AI 评分23
大型音频语言模型中音乐概念的音符级时序定位研究
Note-Level Temporal Grounding of Musical Concepts in Large Audio-Language Models
AI 导读
研究提出 MusicGroundingBench,一个由算法生成的钢琴音频构成、带有精确符号对齐的受控基准,包含三音与两小节设置,用于评测大型音频语言模型的定位与理解能力。实验显示跨模态微调可让模型学会两种能力,但增加定位监督并未在不同骨干模型上稳定提升理解力。两个受测 LALM 在基础音乐概念上的零样本定位仍有限,凸显接地音乐理解仍是开放挑战。
来源:arXiv · Information Retrieval · arxiv.org