Skip to content
arXiv · Artificial Intelligence· Wei Yang, Shawn Li, Yuehan Qin, Yawei Wang, Mingxi Wang, Shixuan Li, Tiankai Yang, Jiate Li, Jesse Thomason, Xuezhe Ma, Yue Zhao·· 4 hr agoAI score37

SynCo:基于多智能体强化学习的自进化 LLM 数据合成协同训练框架

SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning

AI brief

研究者提出 SynCo,一种基于多智能体强化学习的智能体数据合成协同训练框架,用于自进化 LLM。SynCo 联合优化两个独立参数化的智能体:根据 Reasoner 能力状态构建训练任务的 Synthesizer,以及从生成经验中学习的 Reasoner,每个合成任务产生的多次 Reasoner rollout 为两者提供互补奖励。

Source: arXiv · Artificial Intelligence · arxiv.org