Skip to content
arXiv · Computation and Language· Shijun Wan, Jiancong Xie, Hang Xu, Jin Duan, Qixiong Wang, Xi Xiang, Maofei Que, Yahui Liu, Zhongyu Wei, Mu Chuan·· 4 hr agoAI score34

AdaptEvo:基于演化监督的自适应智能体学习框架

AdaptEvo: Adaptive Agent Learning with Evolving Supervision

AI brief

AdaptEvo 是一个面向不完美监督学习的框架,将置信自适应策略优化与演化的决策知识及评估规则相结合。其训练模块采用 Confidence-Adaptive GRPO(CA-GRPO)按参考置信度平衡结果与过程奖励,进化模块则从反复失败中合成可复用决策知识并细化过程规则。

Source: arXiv · Computation and Language · arxiv.org