arXiv · Statistics Machine Learning· Yang Peng·· 3 小时前AI 评分18
异步 TD 学习的尖锐统计速率:基于马尔可夫数据的最后迭代分析
Sharp Statistical Rates for Asynchronous TD Learning with Markovian Data
AI 导读
summary_zh: 论文研究有限马尔可夫奖励过程单轨迹上标准表格型 TD 学习的最后迭代,对折扣因子 γ 记 H=(1−γ)⁻¹,证明在最小平稳概率 μ_min 和总变差混合时间 t_mix 下,最后迭代 TD 以高概率达到 sup-norm 误差 ≤ε,所需转移次数为 Õ(H³/(μ_min ε²) + t_mix/μ_min),0<ε≤1。
来源:arXiv · Statistics Machine Learning · arxiv.org