跳到正文
热点事件持续更新

PowerBench:评测模型在权力转移请求中的偏差

1 篇报道1 个报道来源16 小时前 更新

先了解这件事

AI 综述

2026年10月5日,研究者在 arXiv(Machine Learning Theory)发布 PowerBench,用于评测语言模型对权力转移请求的拒绝偏差。该基准区分自我赋能、削弱他人权力和夺取权力三类请求,并设置不转移权力的对照请求。团队开源了覆盖权力领域、情境、受影响方规模和用户既有权力地位的数据集,评测 24 个模型(12 个来自美国开发者、12 个来自中国开发者),并在用户与受影响方国籍互换、AI 智能体作为用户、8 种请求语言三种条件下进行测试。目前报道仅涉及基准发布与评测设置,未披露具体评测结果。

AI 根据报道生成 · 15 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv · Machine Learning Theory
    PowerBench:评测语言模型在权力转移请求中的偏差

    研究者发布 PowerBench,用于评测语言模型对权力转移请求的拒绝偏差,区分自我赋能、削弱他人权力和夺取权力三类,并设置不转移权力的对照请求。团队开源了覆盖权力领域、情境、受影响方规模和用户既有权力地位的数据集,评测 24 个模型(12 个来自美国、12 个来自中国开发者),在用户与受影响方国籍互换、AI 智能体作为用户、8 种请求语言三种条件下测试。

本事件热度走势

当前热度 7·可比范围峰值 10(10月5日 13:00)·近 24 小时可比范围变化 –

02.557.51010月5日13:0010月5日18:0010月5日22:0010月6日03:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。