arXiv · Artificial Intelligence· Stephane Hatgis-Kessell, Myra Cheng, Xiaoxuan Hou, Qian Hu, Rahul Gupta, Natasha Jaques, Emma Brunskill·· 16 小时前AI 评分55
PlurPO:论文提出用多元偏好优化缓解社会谄媚
Mitigating Social Sycophancy via Pluralistic Preference Optimization
AI 导读
论文提出 Pluralistic Preference Optimization(PlurPO),让语言模型在 interpersonal conflict 输入中识别并模拟相关利益方,再训练其生成对所有利益方都可接受的回应,以缓解社会谄媚。
来源:arXiv · Artificial Intelligence · arxiv.org