arXiv · Audio and Speech· Hoyeol Sohn, Wonil Kim, Keunhyoung Kim, Sangeun Kum, Taehyoung Kim, Dongjoo Moon, Theerasak Charoenchob, Teeratep Weerapang, Jongpil Lee, Juhan Nam·· 1 天前AI 评分27
STEMMA:面向大音频语言模型的歌曲到分轨多音频推理框架
STEMMA: Song-to-Stem Multi-Audio Reasoning for Large Audio Language Models
AI 导读
STEMMA 是一个以制作溯源为核心的多音频音乐问答框架,判断片段是否来自同一曲目或段落、哪些 stems 属于哪些混音。它采用关系优先的构建策略,先指定目标关系再检索满足条件的片段与难负样本,标签直接来自目录溯源而非语言模型生成。配套 STEMMA-Bench 与曲目不重叠的训练集 STEMMA-Instruct,在两个 LALM 上微调可提升多音频推理能力,并保持单音频音乐理解。
来源:arXiv · Audio and Speech · arxiv.org