arXiv · Multiagent Systems· Haoran Li, Zengle Ge, Xiaomin Yuan, Yui Lo, Haoxin Li, Songlin Zhou, Qianhui Liu, Jiahua Ying, Yuanhang Liu, Mingju Chen, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen·· 3 小时前AI 评分33
AGAR:用于 LLM 程序演化的强化学习基底
AGAR: a reinforcement learning substrate for LLM program evolution
AI 导读
AGAR(Algorithm Generation As RL)把程序演化形式化为马尔可夫决策过程,动作是模型所基于的模块化前缀而非输出程序,使信用分配、价值估计、自适应探索与经验记忆可分别挂接。
来源:arXiv · Multiagent Systems · arxiv.org