跳到正文
原文
arXiv · Audio and Speech· Hugo Malard, Gael Le Lan, Daniel Wong, David Lou Alon, Yi-Chiao Wu, Sanjeel Parekh·· 1 天前AI 评分23

用于视觉引导音频高亮的条件流匹配方法

Conditional Flow Matching for Visually-Guided Acoustic Highlighting

AI 导读

研究者提出 Conditional Flow Matching(CFM)框架,把视觉引导音频高亮从判别式建模重构为生成式建模,以解决音频重混中不存在一一对应映射的歧义问题。方法引入 rollout loss 惩罚末步漂移,并采用在向量场回归前融合音视频线索的条件模块,实现显式跨模态声源选择。定量与定性评估显示其持续超越此前 SOTA 判别式方法。

来源:arXiv · Audio and Speech · arxiv.org