arXiv · Computer Vision· Hanmo Chen, Chengcheng Liu, Tianxiao Chen, Zheyu Zhang, Siming Zheng, Jinwei Chen, Xu Yang, Cheng Deng, Bo Li, Peng-tao Jiang·· 3 小时前AI 评分34
StereoBind:学习动态空间对应以实现沉浸式联合视频-音频生成
Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation
AI 导读
StereoBind 框架通过运动轨迹将视觉源运动绑定到立体声生成,包含视觉运动绑定、空间轨迹编码器和残差轨迹 RoPE 三种互补机制。研究团队构建了 StereoWorld-29K 大规模立体声音视频数据集和 StereoWorldBench 评测基准。实验表明 StereoBind 在保持整体音视频质量的同时显著提升了立体声生成的空间对齐效果。
来源:arXiv · Computer Vision · arxiv.org