Skip to content
arXiv · Multiagent Systems· Mohamed Ayman Mohamed, Harshil Kotamreddy, Marcos Menon Jose·· 4 hr agoAI score32

自参照社会偏好:在不观察他人奖励的情况下实现合作

Self-Referenced Social Preferences: Cooperation without Observing Others Rewards

AI brief

研究者提出自参照社会偏好方法,让每个智能体学习自身奖励模型并将其应用于其他智能体的观测转移,从而在无需观察他人奖励的情况下评估其结果。该方法在 Escape Room、Clean Up 和 Commons Harvest 三个序列社会困境中验证,智能体在独立学习者无法合作的环境中仍能学会合作行为,并常比拥有真实奖励的智能体更公平地分配联合收益。

Source: arXiv · Multiagent Systems · arxiv.org