arXiv · Machine Learning Theory· Xinfei Wang, Shanchen Pang, Chenhao Zhang, Shudong Wang, Wenhao Ji, Haiyuan Gui, Meng Han, Xiaojian Liao·· 3 小时前AI 评分24
DaCe-DT:面向异构任务的离线多任务强化学习框架
DaCe-DT: Data-Centric Offline Multi-Task Reinforcement Learning via Adaptive Prompts and Trajectory Correction for Heterogeneous Tasks
AI 导读
论文提出离线多任务强化学习框架 DaCe-DT,从数据层面解决提示长度利用不足、随机采样提示段语义无关、碎片化轨迹误导监督三个瓶颈。框架包含长度门控提示掩码(LGPM)、检索增强提示构建(RAPC)和价值自适应回报校准(VARC)。Meta-World 实验显示,DaCe-DT 在最优数据集上平均提升 11.73%,在次优数据集上提升 13.34%,优于现有最先进方法。
来源:arXiv · Machine Learning Theory · arxiv.org