跳到正文
原文
arXiv · Artificial Intelligence· Haomin Luo (University of Cambridge, Models2 AI)·· 5 小时前AI 评分43

自发现 RL 在经验时代:学习历史是资产还是负担?

Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?

AI 导读

研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。

来源:arXiv · Artificial Intelligence · arxiv.org