arXiv · Machine Learning Theory· Dongsu Lee, Haoran Xu, Amy Zhang·· 17 小时前AI 评分37
SCOUT:通过分解价值梯度流实现测试时多智能体协同
Test-time Multi-agent Coordination by Decomposed Value Gradient Flow
AI 导读
论文提出 SCOUT,首个在测试时通过动作精炼将生成式基础模型与学习价值函数结合的离线 MARL 框架。SCOUT 训练流匹配行为先验与分解价值函数两个解耦组件,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,输运步数控制自适应测试时缩放。论文在 IGM 原则下证明联合软价值差的单一项 KL 界,并在离散与连续离线 MARL 基准上取得最佳平均性能,在所有离线到在线配置中均有提升。
来源:arXiv · Machine Learning Theory · arxiv.org