跳到正文
热点事件持续更新

Watch Your Speech:基于文本条件化的视频到语音合成方法

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026-10-02,arXiv 发表一手研究 Watch Your Speech(WYS),提出基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Computer Vision
    Watch Your Speech:基于文本条件化的视频到语音合成方法

    Watch Your Speech(WYS)提出一种基于文本条件化的视频到语音合成框架,通过注意力嵌入融合模块整合文本与视频序列,并采用条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音频视觉同步(LSE-C/D)达到新 SOTA,同时保持有竞争力的文本准确率(WER),主观评估显示生成语音接近人类自然度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。