跳到正文
原文
arXiv · Computer Vision· Yunzhe Xu, Zhe Liu·· 5 小时前AI 评分36

系统性多智能体视觉语言导航:形式化、基准与方法

Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method

AI 导读

论文首次将多智能体视觉语言导航形式化为带依赖与资源约束的协调问题,提出 MAVLN 基准,包含 11,724 条轨迹、145 个场景、最多 4 个智能体与三种指令模式。配套系统 TRISS 集成 LLM 子任务调度器、共享拓扑记忆与冲突感知执行机制,在调度、规划与执行上均存在显著改进空间。

来源:arXiv · Computer Vision · arxiv.org