Skip to content
arXiv · Audio and Speech· William Chen, Prem Seetharaman, Ke Chen, Oriol Nieto, Kevin Duarte, Siddharth Srinivasan Iyer, Mamshad Nayeem Rizve, Zhiwen Cao, Shinji Watanabe, Yuanjun Xiong, Jianming Zhang, Zeyu Jin, Justin Salamon·· 4 hr agoAI score43

CrossEdit:跨模态训练实现丰富的音视频编辑

CrossEdit: Cross-Modal Training Enables Rich Audio-Visual Editing

AI brief

研究者提出 CrossEdit,一个面向图像、音频与视频的统一全模态编辑模型,可零样本完成音视频电影场景编辑。团队利用声学信号的加性特性程序化生成大规模组合式音频编辑对,并结合自监督 AV 掩码重建与精选跨模态任务微调,使指令遵循能力迁移到未见的模态与指令组合。

Source: arXiv · Audio and Speech · arxiv.org