arXiv · Computation and Language· Olivia Macmillan-Scott, Michael Jacobs, Nils Metternich, Mirco Musolesi·· 2 小时前精选AI 评分62
框架叙事:大语言模型中的意识形态模仿现象
Framing the Narrative: Ideological Mimicry in Large Language Models
AI 导读
研究构建 Poli-SHIFT 数据集与评估框架,系统测试七款开源大语言模型在政治议题上的立场变化,发现提示词中的术语、前提和用户信息会显著改变模型输出立场。术语变化即可在 16.9% 的配对比较中逆转模型立场,用户的政治自我陈述也会使回应偏向用户一方。
推荐理由
研究揭示提示词框架可系统性改变大语言模型的政治立场,对个性化信息环境下的AI安全与对齐具有警示意义。
来源:arXiv · Computation and Language · arxiv.org