arXiv · Statistics Machine Learning· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 3 小时前AI 评分33
Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning
Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning
AI 导读
论文提出广义隐式时间抽象(GITA),通过单一价值函数条件化于多个时间步 k,聚合优势加权监督来同时保留局部分辨率与长程信号。在 OGBench 上,GITA 相比 HIQL 平均成功率提升 25 个百分点(相对提升 73%),相比最强固定-k 方法 OTA 提升 7 个百分点(相对提升 14%)。
来源:arXiv · Statistics Machine Learning · arxiv.org