arXiv · Computer Vision· Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek, Daniel Cohen-Or, Ali Mahdavi-Amiri·· 2 小时前精选AI 评分62
Soundwich:分层可控音频的视频生成
Soundwich: Video Generation with Layered and Controllable Audio
AI 导读
Soundwich 是一种训练免框架,将冻结的联合音视频流匹配模型转为生成多个同步且可独立编辑的音频 stem,并与共享视频耦合。它通过共享场景表征保持跨 stem 的全局音视频一致性,同时保留源级分离,并将跨模态交互路由到对应视觉源,提升音画一致性。
推荐理由
提出训练免方案将联合音视频模型解为多轨可编辑音频,为视频生成提供可迁移的音轨分离与重定时方法。
来源:arXiv · Computer Vision · arxiv.org