arXiv · Multiagent Systems· Matthias Gerstgrasser, Gianluca Brero, Alon Eden, Darshan Chakrabarti, Nicolas Lepore, Vincent Li, Eric Mibuari, Amy Greenwald, David C. Parkes·· 3 小时前AI 评分29
Stackelberg POMDP:用强化学习学习如何领导
Stackelberg POMDP: Learning to Lead via Reinforcement Learning
AI 导读
提出 Stackelberg POMDP 框架,将跟随者适应嵌入领导者的环境,构造单智能体部分可观测马尔可夫决策过程,用于部分观测、多跟随者的序贯领导-跟随问题。
来源:arXiv · Multiagent Systems · arxiv.org