跳到正文
原文
arXiv · Multiagent Systems· Matthias Gerstgrasser, Gianluca Brero, Alon Eden, Darshan Chakrabarti, Nicolas Lepore, Vincent Li, Eric Mibuari, Amy Greenwald, David C. Parkes·· 3 小时前AI 评分29

Stackelberg POMDP:用强化学习学习如何领导

Stackelberg POMDP: Learning to Lead via Reinforcement Learning

AI 导读

提出 Stackelberg POMDP 框架,将跟随者适应嵌入领导者的环境,构造单智能体部分可观测马尔可夫决策过程,用于部分观测、多跟随者的序贯领导-跟随问题。

来源:arXiv · Multiagent Systems · arxiv.org