arXiv · Statistics Machine Learning· Jia Wan, Sean R. Sinclair, Devavrat Shah, Martin J. Wainwright·· 3 小时前AI 评分30
Exploiting Exogenous Structure for Sample-Efficient Reinforcement Learning
Exploiting Exogenous Structure for Sample-Efficient Reinforcement Learning
AI 导读
研究 Exo-MDPs 结构化类,将离散 MDP、Exo-MDP 与离散线性混合 MDP 建立表示等价性。在 exogenous 状态不可观测时,最小最大遗憾界为 Θ(Hr√K);可观测时改进至 Θ(H√rK),揭示 Θ(√r) 统计差距。实验在库存控制与资源分配上验证结论。
来源:arXiv · Statistics Machine Learning · arxiv.org