跳到正文
原文
arXiv · Artificial Intelligence· Weihan Xu, Kan Jen Cheng, Koichi Saito, Jingyu Shi, Tingle Li, Yisi Liu, Liming Wang, Masato Ishii, Takashi Shibuya, Gopala Anumanchipalli, Paul Pu Liang·· 6 小时前AI 评分38

AVIO:学习在音视频场景中添加与移除发声物体

AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes

AI 导读

AVIO 通过源条件特征调制适配预训练文本到音视频生成模型,联合学习物体添加与移除,并引入参考帧课程逐步减少参考条件以实现仅指令编辑。AVIOBench 数据集包含 37.9 小时、覆盖 1,878 个目标物体名称的配对音视频样本,通过视觉定位与跨模态一致性筛选目标声音移除候选。定量与定性评估表明,AVIO 在音视频物体移除与添加上有效,可选参考引导为添加提供外观与位置控制。

来源:arXiv · Artificial Intelligence · arxiv.org