跳到正文
原文
arXiv · Multiagent Systems· S. Rasoul Etesami·· 7 小时前AI 评分12

随机博弈中未知独立链的完全在线去中心化学习

Fully Online Decentralized Learning in Stochastic Games with Unknown Independent Chains

AI 导读

针对具有未知独立链的随机博弈,提出一种完全在线、去中心化且无需协调的镜像下降算法,在占用度量对偶空间中逼近平稳纳什均衡策略。算法每步仅用单条转移/奖励样本,依赖局部信息,无需联合状态空间覆盖或同步回合。在一致遍历与有限覆盖假设下,时间平均固定比较器遗憾以 O(T^{-1/2}) 速率衰减,复杂度取决于各局部状态空间的覆盖时间而非乘积空间,避免随玩家数量指数增长。

来源:arXiv · Multiagent Systems · arxiv.org