Skip to content
arXiv · Multiagent Systems· Matthias Gerstgrasser, Gianluca Brero, Alon Eden, Darshan Chakrabarti, Nicolas Lepore, Vincent Li, Eric Mibuari, Amy Greenwald, David C. Parkes·· 4 hr agoAI score29

Stackelberg POMDP:用强化学习学习如何领导

Stackelberg POMDP: Learning to Lead via Reinforcement Learning

AI brief

提出 Stackelberg POMDP 框架,将跟随者适应嵌入领导者的环境,构造单智能体部分可观测马尔可夫决策过程,用于部分观测、多跟随者的序贯领导-跟随问题。

Source: arXiv · Multiagent Systems · arxiv.org