arXiv · Artificial Intelligence· Yuxuan Fan, Jaehong Yoon·· 16 小时前AI 评分40
MetaRubric:面向基于评分标准的强化学习的奖励学习方法
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
AI 导读
MetaRubric 提出通过证据感知的策略优化与响应引导的评分标准自适应交替进行,解决评分标准裁判在所需信息缺失时仍给出高分的“Vacuous Credit”问题。
来源:arXiv · Artificial Intelligence · arxiv.org