Skip to content
arXiv · Machine Learning Theory· Xinfei Wang, Shanchen Pang, Chenhao Zhang, Shudong Wang, Wenhao Ji, Haiyuan Gui, Meng Han, Xiaojian Liao·· 4 hr agoAI score24

DaCe-DT:面向异构任务的离线多任务强化学习框架

DaCe-DT: Data-Centric Offline Multi-Task Reinforcement Learning via Adaptive Prompts and Trajectory Correction for Heterogeneous Tasks

AI brief

论文提出离线多任务强化学习框架 DaCe-DT,从数据层面解决提示长度利用不足、随机采样提示段语义无关、碎片化轨迹误导监督三个瓶颈。框架包含长度门控提示掩码(LGPM)、检索增强提示构建(RAPC)和价值自适应回报校准(VARC)。Meta-World 实验显示,DaCe-DT 在最优数据集上平均提升 11.73%,在次优数据集上提升 13.34%,优于现有最先进方法。

Source: arXiv · Machine Learning Theory · arxiv.org