跳到正文
原文
arXiv · Computation and Language· Ting-Chih Chen, Emile van Krieken, Shujian Yu, Filip Ilievski·· 6 小时前AI 评分34

Question-Specific Knowledge Graphs for Efficient Visual Reasoning

Question-Specific Knowledge Graphs for Efficient Visual Reasoning

AI 导读

summary_zh: VisKG 是一种基于强化学习的视觉推理框架,将图像转化为问题特定的知识图谱表示,在保持链式推理所需实体关系的同时过滤感知噪声。实验显示 VisKG 在科学、数学和通用视觉理解基准上达到与基线相当或更好的性能,同时所需 token 数更少;采用 GDPO 训练相比 GRPO 平均提升 2% 准确率。

来源:arXiv · Computation and Language · arxiv.org