arXiv · Computation and Language· Yuhan Guo, Jinming Liu, Liang Xu, Ziqiang Li, Jianguo Huang, Zhicheng Wang, Hu Zhu, Qiuyu Chen, Yuntao Wei, Xin Jin, Wenjun Zeng·· 3 小时前AI 评分42
EVOKE:通过目标多样性激发智能体内部化世界知识的可迁移决策
EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making
AI 导读
EVOKE 是一种后训练方法,通过在固定状态和环境历史下对同一组候选动作施加不同目标进行排序,迫使策略改变动作偏好,从而隐式激发预训练中内化的世界知识。该方法在三个骨干模型上的多种任务中验证了任务性能、未见环境泛化和数据效率的提升。论文指出,常规后训练因单目标监督使策略依赖表面上下文习惯,而 EVOKE 提供了激发所需压力。
来源:arXiv · Computation and Language · arxiv.org