跳到正文
原文
arXiv · Audio and Speech· Zitong Lan, Mutian Tong, Jiatao Gu, Mingmin Zhao·· 7 小时前AI 评分50

OmniDream:从任意单目视频生成沉浸式音视频体验

Enabling Immersive Audio-Visual Experience from Any Video

AI 导读

OmniDream 是一个无需训练的框架,将无声单目视频转换为沉浸式音视频体验,观众可自由环视而声音与视觉场景保持空间对齐。其核心是对象中心的音频表示,将声音源的内在音频内容与场景相关声学效应解耦,支持独立音频生成、基于物理的传播模拟和灵活空间音频渲染。实验显示在音频-视觉对齐、空间正确性和感知沉浸感上优于基线。

来源:arXiv · Audio and Speech · arxiv.org