arXiv · Multiagent Systems· Ond\v{r}ej Kub\'i\v{c}ek, Viliam Lis\'y, Tuomas Sandholm·· 7 小时前AI 评分22
连续动作博弈的正则化策略梯度方法:高斯混合与磁镜下降结合自博弈训练
Regularized policy gradient with learned mixtures of Gaussians for games with continuous actions
AI 导读
提出一种结合磁镜下降与高斯混合重参数化的可扩展策略梯度算法,用于连续或混合动作的大规模序贯博弈。在序贯博弈中比神经虚构自博弈快3.5–5.5倍,与PSRO最终策略持平或更优;德州扑克单挑无上限注中表现与Slumbot相当。
来源:arXiv · Multiagent Systems · arxiv.org