跳到正文
热点事件持续更新

自参照社会偏好:无需观察他人奖励的多智能体合作

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

研究者提出自参照社会偏好方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测转移,从而在无需观察他人奖励的情况下评估其结果。该方法在 Escape Room、Clean Up 和 Commons Harvest 三个序列社会困境中验证,智能体在独立学习者无法合作的环境中仍能学会合作行为,并常比拥有真实奖励的智能体更公平地分配联合收益。目前未见与早先报道矛盾之处。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Multiagent Systems
    自参照社会偏好:在不观察他人奖励的情况下实现合作

    研究者提出自参照社会偏好方法,让每个智能体学习自身奖励模型并将其应用于其他智能体的观测转移,从而在无需观察他人奖励的情况下评估其结果。该方法在 Escape Room、Clean Up 和 Commons Harvest 三个序列社会困境中验证,智能体在独立学习者无法合作的环境中仍能学会合作行为,并常比拥有真实奖励的智能体更公平地分配联合收益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。