arXiv · Robotics· Arunabh Bora·· 16 小时前AI 评分36
超越奖励黑客:分阶段人形机器人学习流水线四层代理偏差
Beyond Reward Hacking: Proxy Divergence Across Four Layers of a Staged Humanoid Learning Pipeline
AI 导读
论文提出,分阶段人形机器人 RL 流水线中奖励、课程门、评测统计与参考动作四类代理各有偏差机制,并给出对应重构方案,包括一阶 L1 代价、峰值与结果统计、门可达性与信息检查、确定性且相位去同步评测、课程状态纳入模型、可行性优先参考设计与残差前馈、以及函数保持输入扩展。
来源:arXiv · Robotics · arxiv.org