跳到正文
原文
arXiv · Multiagent Systems· Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig·· 16 小时前AI 评分55

Recursive Agent Optimization 研究提出递归智能体强化学习方法

Recursive Agent Optimization

AI 导读

论文提出 Recursive Agent Optimization(RAO),一种训练递归智能体的强化学习方法,让智能体能够递归地向自身的新实例派生并委派子任务。RAO 教会模型何时以及如何委派与通信,使智能体在推理时通过分治扩展到更长上下文,泛化到比训练时更难的任务,并可能降低相对单智能体系统的实际耗时。

来源:arXiv · Multiagent Systems · arxiv.org