热点事件持续更新
Fair Policy Optimization in Major-Minor Weakly Coupled MDPs
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026-09-30,arXiv·Machine Learning 报道一项关于主-从弱耦合马尔可夫决策过程(M2WCMDP)中公平策略优化的研究。研究提出优化单调、凹、置换不变归一化公平函数的方法;对于同质从属子 MDP,证明问题可简化为平台加参与者均值效用目标的优化;对于一般情况,引入基于计数比例的深度强化学习方法与优先级采样器生成可行计数动作。研究在纽约市校准数据集上进行了定价与出租车调度联合控制实验,验证了方法的有效性与可扩展性。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · Machine Learning公平策略优化在主-从弱耦合马尔可夫决策过程中的研究
研究提出在主-从弱耦合马尔可夫决策过程(M2WCMDP)框架下优化单调、凹、置换不变归一化公平函数的方法。对于同质从属子MDP,证明问题可简化为平台加参与者均值效用目标的优化。对于一般情况,引入基于计数比例的深度强化学习方法与优先级采样器生成可行计数动作。在纽约市校准数据集上的定价与出租车调度联合控制实验中验证了方法的有效性与可扩展性。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。