跳到正文
原文
arXiv · Computer Vision· Gunwoo Lee, Yoori Oh, Yoseob Han·· 3 小时前AI 评分25

Watch Your Speech:基于文本条件化的视频到语音合成方法

Watch Your Speech: Text-aware Video-to-Speech Synthesis with Textual Conditioning

AI 导读

Watch Your Speech(WYS)提出一种基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。

来源:arXiv · Computer Vision · arxiv.org