Hot eventLive
Watch Your Speech:基于文本条件化的视频到语音合成方法
1 reports1 sources3 hr ago updated
Get the story
AI overview
2026-10-02,arXiv 发表一手研究 Watch Your Speech(WYS),提出基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。
Generated from reports · updated 2 hr ago
LatestOct 2
WYS 在 LRS2/LRS3 上音频视觉同步达新 SOTA,主观自然度接近人类。Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Computer VisionWatch Your Speech:基于文本条件化的视频到语音合成方法
Watch Your Speech(WYS)提出一种基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。
Heat trend
There is not enough continuous observation data to draw a trend yet.