Skip to content
Hot eventLive

Watch Your Speech:基于文本条件化的视频到语音合成方法

1 reports1 sources3 hr ago updated

Get the story

AI overview

2026-10-02,arXiv 发表一手研究 Watch Your Speech(WYS),提出基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。

Generated from reports · updated 2 hr ago

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Computer Vision
    Watch Your Speech:基于文本条件化的视频到语音合成方法

    Watch Your Speech(WYS)提出一种基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。

Heat trend

There is not enough continuous observation data to draw a trend yet.