Skip to content
arXiv · Audio and Speech· Pengjun Fang, Jingyi Fa, Kam Man Wu, Jiaming Wang, Haoyuan Huang, Yaguang Wu, Xiangjun Huang, Ziyang Ma, Weijia Chen, Hongyu Liu, Zeyue Tian, Qifeng Chen·· 4 hr agoAI score40

WorldSonus:为世界模型带来实时空间声音合成

WorldSonus: Bringing Sound to Worlds

AI brief

WorldSonus 是一个面向世界模型的交互式视频转音频框架,用于实时空间声音合成。它采用流式因果自回归扩散架构,以 0.41 的实时因子(RTF)合成音频块,并通过以音频为中心的字幕管线与按块索引的提示词调度实现生成中的动态声音控制。实验显示,WorldSonus 在开放域视频转音频基准上可匹配或超越现有双向模型的声学质量与空间对齐表现。

Source: arXiv · Audio and Speech · arxiv.org