跳到正文
原文
arXiv · Computation and Language· Shijun Wan, Jiancong Xie, Hang Xu, Jin Duan, Qixiong Wang, Xi Xiang, Maofei Que, Yahui Liu, Zhongyu Wei, Mu Chuan·· 3 小时前AI 评分34

AdaptEvo:基于演化监督的自适应智能体学习框架

AdaptEvo: Adaptive Agent Learning with Evolving Supervision

AI 导读

AdaptEvo 是一个面向不完美监督学习的框架,将置信自适应策略优化与演化的决策知识及评估规则相结合。其训练模块采用 Confidence-Adaptive GRPO(CA-GRPO)按参考置信度平衡结果与过程奖励,进化模块则从反复失败中合成可复用决策知识并细化过程规则。

来源:arXiv · Computation and Language · arxiv.org