arXiv · Audio and Speech· Peihao Chen, Qing Wang, Lichun Fan, Yufeng Hao, Zhifeng Kong, Mengyao Zhu, Hengyi Hong, Hang Chen, Hang Su, Yujie Jian, Chao-Han Huck Yang, Shichao Hu, Jun Du, Jian Luan, Ke Li·· 7 小时前AI 评分31
RMS-AQA:面向真实家庭环境的两阶段空间音频问答基准
RMS-AQA: A Two-Stage Spatial Audio Question Answering Benchmark for Real-World Domestic Environments
AI 导读
RMS-AQA 是一个针对真实家庭环境的空间音频问答(SAQA)基准,采用两阶段 QA 格式,先定位可听声音事件,再进行时空推理。数据集融合真实一阶 Ambisonics 录音与基于测量房间脉冲响应(RIR)的高保真合成数据,并提供轻量空间插件注入 FOA 格式数据到冻结音频语言骨干网络。实验表明主要挑战来自并发声源、远距离以及 RIR 合成与真实录音之间的 sim-to-real 域差距。
来源:arXiv · Audio and Speech · arxiv.org