arXiv · Audio and Speech· Pol Buitrago, Javier Hernando·· 5 小时前AI 评分37
零音视频资源场景下的音视频语音识别自举方法
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios
AI 导读
研究在零真实音视频资源场景下,仅用合成视觉数据自举音视频语音识别(AVSR)。团队合成超700小时说话人视频并微调预训练AV-HuBERT模型,在手动标注的加泰罗尼亚语基准上达到接近SOTA的性能,参数和训练数据远少于Whisper-large-v3,且优于纯音频基线、在声学降级下仍保持多模态优势。
来源:arXiv · Audio and Speech · arxiv.org