跳到正文
原文
arXiv · Statistics Machine Learning· Gefei Lin, Rui Miao, Xiaoke Zhang·· 9 小时前AI 评分14

Fitted Q-Iteration 有限样本理论:动作作为函数时的折扣无限时域研究

Finite-Sample Theory for Fitted Q-Iteration When Actions Are Functions

AI 导读

summary_zh: 论文研究折扣无限时域下拟合 Q 迭代(FQI)在函数动作空间中的有限样本理论,针对函数动作缺乏勒贝格密度、传统覆盖条件过强、函数动作空间过大导致贪心优化困难三个挑战,引入基于评论器的相对覆盖条件并给出学习策略遗憾的多项式衰减界。

来源:arXiv · Statistics Machine Learning · arxiv.org