arXiv · Audio and Speech· Joanna Hong, Sanjeel Parekh, Honglie Chen, Jacob Donley, Ke Tan, Buye Xu, Anurag Kumar·· 7 小时前AI 评分33
音视频语音处理的高效方法:MUTUD 多模态训练与单模态部署框架
Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment
AI 导读
论文提出 MUTUD 框架,在训练阶段使用音视频多模态数据,推理阶段仅用单一模态,通过 TAME 模块估计缺失模态信息。该方法在多种音视频语音任务上缩小了多模态与单模态模型的性能差距,同时减少模型规模和计算量,部分场景降低近 80%。相关成果已发表于 TMLR,arXiv 版本为 2501.18157v2。
来源:arXiv · Audio and Speech · arxiv.org