跳到正文
原文
arXiv · Multiagent Systems· Amit Thakur, Mukesh Singhal·· 16 小时前AI 评分24

面向开放团队多智能体强化学习的周转正交信用分配方法 TOCA

Turnover-Orthogonal Credit Assignment for Open-Team Multi-Agent Reinforcement Learning

AI 导读

研究者提出周转正交信用分配(TOCA),一种面向开放团队多智能体强化学习的价值分解方法,将动作效应、纯周转效应与动作—周转交互分离开。该方法用置换不变的集中式 critic 处理可变规模智能体集合与事件 token,并导出反事实逐智能体信用信号及软加权交互变体 TOCA-$\beta$。

来源:arXiv · Multiagent Systems · arxiv.org