跳到正文
原文
arXiv · Multiagent Systems· Ond\v{r}ej Kub\'i\v{c}ek, Viliam Lis\'y, Tuomas Sandholm·· 7 小时前AI 评分22

连续动作博弈的正则化策略梯度方法:高斯混合与磁镜下降结合自博弈训练

Regularized policy gradient with learned mixtures of Gaussians for games with continuous actions

AI 导读

提出一种结合磁镜下降与高斯混合重参数化的可扩展策略梯度算法,用于连续或混合动作的大规模序贯博弈。在序贯博弈中比神经虚构自博弈快3.5–5.5倍,与PSRO最终策略持平或更优;德州扑克单挑无上限注中表现与Slumbot相当。

来源:arXiv · Multiagent Systems · arxiv.org