arXiv · Machine Learning· Xiaohui Tu, Yossiri Adulyasak, Erick Delage·· 7 小时前AI 评分17
公平策略优化在主-从弱耦合马尔可夫决策过程中的研究
Fair Policy Optimization in Major-Minor Weakly Coupled Markov Decision Processes
AI 导读
研究提出在主-从弱耦合马尔可夫决策过程(M2WCMDP)框架下优化单调、凹、置换不变归一化公平函数的方法。对于同质从属子MDP,证明问题可简化为平台加参与者均值效用目标的优化。对于一般情况,引入基于计数比例的深度强化学习方法与优先级采样器生成可行计数动作。在纽约市校准数据集上的定价与出租车调度联合控制实验中验证了方法的有效性与可扩展性。
来源:arXiv · Machine Learning · arxiv.org