arXiv · Multiagent Systems· Amit Thakur, Mukesh Singhal·· 16 小时前AI 评分24
面向开放团队多智能体强化学习的周转正交信用分配方法 TOCA
Turnover-Orthogonal Credit Assignment for Open-Team Multi-Agent Reinforcement Learning
AI 导读
研究者提出周转正交信用分配(TOCA),一种面向开放团队多智能体强化学习的价值分解方法,将动作效应、纯周转效应与动作—周转交互分离开。该方法用置换不变的集中式 critic 处理可变规模智能体集合与事件 token,并导出反事实逐智能体信用信号及软加权交互变体 TOCA-$\beta$。
来源:arXiv · Multiagent Systems · arxiv.org