跳到正文
原文
arXiv · Computer Vision· Shenglan Li, Zhendong Mi, Hengyi Zhu, Jingwu Luo, Chun Kit Chan, Geng Yuan, Yanzhi Wang, Pu Zhao, Shaoyi Huang·· 1 天前AI 评分37

IG-VLA:让 VLA 模型内化时空想象,实现高效推理

Imagine the Future, Internalize the Gist: Efficient VLA Reasoning via Internalized Spatiotemporal Imagination

AI 导读

提出 IG-VLA 框架,让 VLA 模型在视觉表示空间中想象任务相关的未来场景演化,并用 Scene Gist Memory 将推理得到的场景-行为关联压缩为 Scene Gist Token,避免推理时显式生成未来画面。

来源:arXiv · Computer Vision · arxiv.org