随机博弈中未知独立链的完全在线去中心化学习
Get the story
2026-10-02,arXiv Multiagent Systems 报道:针对具有未知独立链的随机博弈,提出一种完全在线、去中心化且无需协调的镜像下降算法,在占用度量对偶空间中逼近平稳纳什均衡策略。算法每步仅用单条转移/奖励样本,依赖局部信息,无需联合状态空间覆盖或同步回合。在一致遍历与有限覆盖假设下,时间平均固定比较器遗憾以 O(T^{-1/2}) 速率衰减,复杂度取决于各局部状态空间的覆盖时间而非乘积空间,避免随玩家数量指数增长。
Generated from reports · updated 6 hr ago
Timeline
Follow the coverage from different angles.
- arXiv · Multiagent Systems随机博弈中未知独立链的完全在线去中心化学习
针对具有未知独立链的随机博弈,提出一种完全在线、去中心化且无需协调的镜像下降算法,在占用度量对偶空间中逼近平稳纳什均衡策略。算法每步仅用单条转移/奖励样本,依赖局部信息,无需联合状态空间覆盖或同步回合。在一致遍历与有限覆盖假设下,时间平均固定比较器遗憾以 O(T^{-1/2}) 速率衰减,复杂度取决于各局部状态空间的覆盖时间而非乘积空间,避免随玩家数量指数增长。
Heat trend
Current heat 8·Comparable peak 10(Oct 2)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.