arXiv · Machine Learning Theory· Sreejeet Maity, Aritra Mitra·· 3 小时前AI 评分22
从不可靠轨迹中学习:对抗鲁棒的联邦 Q-Learning
Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning
AI 导读
论文研究多智能体在共享 MDP 中通过中央服务器协作学习最优状态-动作值函数,并提出 Robust Async-Fed-Q 算法,结合智能体端对方差缩减的 Bellman 最优算子估计与服务器端鲁棒聚合。
来源:arXiv · Machine Learning Theory · arxiv.org