SCOUT:测试时多智能体协调框架
Get the story
2026年10月5日,arXiv Machine Learning Theory 发表论文提出 SCOUT,被称为首个在测试时通过动作精炼将生成式基础模型与学习价值函数结合的离线多智能体强化学习(MARL)框架。SCOUT 训练流匹配行为先验与分解价值函数两个解耦组件,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,输运步数控制自适应测试时缩放。论文在 IGM 原则下证明联合软价值差的单一项 KL 界,并在离散与连续离线 MARL 基准上取得最佳平均性能,在所有离线到在线配置中均有提升。目前仅见此一篇报道,尚无后续验证或独立复现信息。
Generated from reports · updated 17 hr ago
Timeline
Follow the coverage from different angles.
- arXiv · Machine Learning TheorySCOUT:通过分解价值梯度流实现测试时多智能体协同
论文提出 SCOUT,首个在测试时通过动作精炼将生成式基础模型与学习价值函数结合的离线 MARL 框架。SCOUT 训练流匹配行为先验与分解价值函数两个解耦组件,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,输运步数控制自适应测试时缩放。论文在 IGM 原则下证明联合软价值差的单一项 KL 界,并在离散与连续离线 MARL 基准上取得最佳平均性能,在所有离线到在线配置中均有提升。
Heat trend
Current heat 6·Comparable peak 10(Oct 5)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.