跳到正文
原文
arXiv · Computer Vision· Yiyang Huang, Yitian Zhang, Yizhou Wang, Jianglin Lu, Qihua Dong, Hailing Wang, Huimin Zeng, Mingyuan Zhang, Yun Fu·· 4 小时前AI 评分27

RACER:面向长视频理解的反思智能体框架,耦合查询解释与工具检索实现帧选择

RACER: Reflective Agent Coupling Query Interpretation and Tool-Based Retrieval for Frame Selection in Long Video Understanding

AI 导读

论文提出 RACER,一个免训练的反思智能体框架,用于长视频帧选择。该框架将任务分解为由轻量视频大语言模型驱动的查询解释,以及由嵌入模型作为检索工具支撑的证据定位,并通过子查询细化形成反思循环。在多个基准测试中,RACER 一致提升长视频理解效果,且在组件能力有限时仍能实现有效帧选择。

来源:arXiv · Computer Vision · arxiv.org