跳到正文
原文
arXiv · Computer Vision· Wenfang Sun, Yingjun Du, Cees G. M. Snoek·· 3 小时前AI 评分33

SAVER:用稠密参考强化稀疏视频推理

Less from More: Reinforcing Sparse Video Reasoning from Dense References

AI 导读

研究者提出 SAVER,一种稠密到稀疏的视频后训练框架,用稠密视频视图作为训练期参考,以接地奖励和可靠性门控参考奖励优化稀疏视图预测。SAVER 仅用 1,250 个随机采样的时序接地样本训练,未使用任何视频问答标注。在三个时序接地基准和六个视频问答基准上,SAVER 在不同帧数预算下均提升表现,可匹配或超越稠密帧 Qwen3.5 基线,同时使用明显更少的帧。

来源:arXiv · Computer Vision · arxiv.org