跳到正文
热点事件持续更新

MUTUD:多模态训练单模态部署的音视频语音处理方法

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,arXiv Audio and Speech 频道发布一手研究,提出 MUTUD 框架:训练阶段利用音视频多模态数据,推理阶段仅用单一模态,并通过 TAME 模块估计缺失模态信息。该方法在多种音视频语音任务上缩小了多模态与单模态模型的性能差距,同时减少模型规模与计算量,部分场景降低近 80%。相关成果已发表于 TMLR,arXiv 版本为 2501.18157v2。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Audio and Speech
    音视频语音处理的高效方法:MUTUD 多模态训练与单模态部署框架

    论文提出 MUTUD 框架,在训练阶段使用音视频多模态数据,推理阶段仅用单一模态,通过 TAME 模块估计缺失模态信息。该方法在多种音视频语音任务上缩小了多模态与单模态模型的性能差距,同时减少模型规模和计算量,部分场景降低近 80%。相关成果已发表于 TMLR,arXiv 版本为 2501.18157v2。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。