arXiv · Artificial Intelligence· Tianyu Chen, Mingyuan Zhou, Jiaxing Wu·· 8 hr agoSelectedAI score62
Learning to Route in Visual Space via Multi-Step Embedding Retrieval
Learning to Route in Visual Space via Multi-Step Embedding Retrieval
AI brief
论文提出 VHOP 数据生成框架与 VHOP-Router 端到端训练管线,将标准嵌入模型转为自回归多步检索器,直接在视觉潜在空间检索关联图像链。实验显示检索率从不足 5% 提升至 76.3%,智能体搜索成功率提高 52.7%,平均 token 长度从 1886 降至 728,同时减少上下文图像 23 倍、累计 API 负载 35 倍。
Why it matters
论文提出端到端训练方案,将检索器改造为多步自回归模型,在视觉智能体搜索上显著提升成功率并大幅降低 token 开销。
Source: arXiv · Artificial Intelligence · arxiv.org