Skip to content
arXiv · Multiagent Systems· Haoran Li, Zengle Ge, Xiaomin Yuan, Yui Lo, Haoxin Li, Songlin Zhou, Qianhui Liu, Jiahua Ying, Yuanhang Liu, Mingju Chen, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen·· 4 hr agoAI score33

AGAR:用于 LLM 程序演化的强化学习基底

AGAR: a reinforcement learning substrate for LLM program evolution

AI brief

AGAR(Algorithm Generation As RL)把程序演化形式化为马尔可夫决策过程,动作是模型所基于的模块化前缀而非输出程序,使信用分配、价值估计、自适应探索与经验记忆可分别挂接。

Source: arXiv · Multiagent Systems · arxiv.org