跳到正文
原文
arXiv · Multiagent Systems· Abhishek Sriraman, Eleni Vasilaki, Robert Loftin·· 3 小时前AI 评分27

ConventionPlay:面向稳健临时协作的能力受限训练

ConventionPlay: Capability-Limited Training for Robust Ad-Hoc Collaboration

AI 导读

提出 ConventionPlay,一种基于 RL 的临时协作训练方法,让智能体通过与具有不同适应程度的伙伴群体对练来发现对方的最优约定。训练群体中部分伙伴只遵循单一固定约定,部分能适应任务中若干可能约定的子集,从而迫使智能体主动探测伙伴能力并引导其采用最有效的联合策略。实验显示,在与兼容多种约定的测试伙伴群体对抗时,ConventionPlay 训练的智能体优于现有临时协作方法。

来源:arXiv · Multiagent Systems · arxiv.org