跳到正文
原文
arXiv · Machine Learning Theory· Zhaojun Peng·· 5 小时前AI 评分20

Bellman-Certified Rounding for Sparse Policy Deployment in MDPs

Bellman-Certified Rounding for Sparse Policy Deployment in MDPs

AI 导读

论文研究有限 MDP 中连续策略混合舍入为稀疏二进制策略时如何保留折扣回报,通过 2d+2 次 Bellman 求解得到可复用包络,在舍入前提供均匀与候选特定保证。候选特定界将结构化测试集上的认证覆盖率从 48.2% 提升至 74.1%,在 γ=0.95 时局部积分把中位界损失比从 402.3 降至 2.08。论文证明当预算线性增长时线性维度依赖不可避免,且精确全局曲率阈值判定是 NP 难问题。

来源:arXiv · Machine Learning Theory · arxiv.org