跳到正文
原文
arXiv · Audio and Speech· Sripathi Sridhar, Gordon Wichern, Yoshiki Masuyama, Mark Cartwright, Jonathan Le Roux·· 16 小时前AI 评分18

评测语义声景分割的推理时算法

Evaluating Inference-time Algorithms for Semantic Sound Scene Segmentation

AI 导读

研究构建多通道检测-提取模型,并评测推理时算法以改进多阶段架构中的类别检测与目标声音提取。评估了二元交叉熵与混合一致性两种适应度函数、朴素与条件混淆矩阵重标注两种策略,以及多标签分类器、微调单源分类器和现成音频评判三种源估计评估模型。在 DCASE 2025 Task 4 数据集上验证设计选择影响,并在留出评估集上验证基于熵的推理时更新门控机制。

来源:arXiv · Audio and Speech · arxiv.org