跳到正文
原文
arXiv · Audio and Speech· Pol Buitrago, Javier Hernando·· 5 小时前AI 评分37

零音视频资源场景下的音视频语音识别自举方法

Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios

AI 导读

研究在零真实音视频资源场景下,仅用合成视觉数据自举音视频语音识别(AVSR)。团队合成超700小时说话人视频并微调预训练AV-HuBERT模型,在手动标注的加泰罗尼亚语基准上达到接近SOTA的性能,参数和训练数据远少于Whisper-large-v3,且优于纯音频基线、在声学降级下仍保持多模态优势。

来源:arXiv · Audio and Speech · arxiv.org