跳到正文
原文
arXiv · Multiagent Systems· Chaoyuan Hao, Wentao Yue, Tianyou Lai, Hongji Li, Jiayi Zhou, Qingyu Mao, Qilei Li·· 3 小时前AI 评分33

多智能体强化学习中的梯度路由与优化器依赖的合作关系维护

After Cooperation Is Learned: Gradient Routing and Optimizer-Dependent Maintenance in Multi-Agent Reinforcement Learning

AI 导读

论文研究合作型多智能体强化学习中,已学会的合作策略在持续训练下是否会被破坏。将合作关系维护定义为行为验证过的合作策略在持续训练中的存活问题,形式化为右删失事件时间问题。实验表明,直接值梯度路由(X0)在更高奖励缩放下选择性增加维护敏感性,而保留评论家但阻断梯度(X1)接近删失上限,移除评论家(X5)在测试设置中无确认事件。

来源:arXiv · Multiagent Systems · arxiv.org