跳到正文
原文
arXiv · Information Retrieval· Shuquan Wei, Xi Chen, Xu Chen, Xiangyang Jia·· 3 小时前AI 评分15

MMTI:通过多维显著性评估与粒度感知查询分解实现文本-视频检索

Text-Video Retrieval via Multi-Dimensional Saliency Assessment and Granularity-Aware Query Decomposition

AI 导读

MMTI 通过关键特征选择(KFS)机制联合评估多维显著性与可学习重要性分数,自适应聚合信息帧与图像块以压缩视觉特征、缓解冗余。文本-视频交互模块(TVIM)利用动态门控将查询分解为句子、帧与图像块(SFP),实现多粒度对齐。在四个标准基准上超越现有最优方法。

来源:arXiv · Information Retrieval · arxiv.org