跳到正文
原文
arXiv · Machine Learning Theory· Nicolas Martorell, Wendy Brau, Gonzalo A. Heredia, Tom\'as Pablo Korenblit, Gaspar Labasti\'e, Tom\'as Gimenez Molina·· 16 小时前AI 评分55

PowerBench:评测语言模型在权力转移请求中的偏差

PowerBench: Measuring Language Model Bias in Power-shifting Requests

AI 导读

研究者发布 PowerBench,用于评测语言模型对权力转移请求的拒绝偏差,区分自我赋能、削弱他人权力和夺取权力三类,并设置不转移权力的对照请求。团队开源了覆盖权力领域、情境、受影响方规模和用户既有权力地位的数据集,评测 24 个模型(12 个来自美国、12 个来自中国开发者),在用户与受影响方国籍互换、AI 智能体作为用户、8 种请求语言三种条件下测试。

来源:arXiv · Machine Learning Theory · arxiv.org