arXiv · Artificial Intelligence· Haomin Luo (University of Cambridge, Models2 AI)·· 5 小时前AI 评分43
自发现 RL 在经验时代:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
AI 导读
研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。
来源:arXiv · Artificial Intelligence · arxiv.org