跳到正文
原文
arXiv · Computation and Language· Lin Tian, Marian-Andrei Rizoiu·· 16 小时前AI 评分47

无触发器也能传播错误信息:从事实答案到下游决策

Misinformation Without Triggers: From Factual Answers to Downstream Decisions

AI 导读

研究发现,模型在无触发器投毒下仍会改变事实答案与下游决策,直接探测与模型实际行为之间存在审计缺口。在 Guess the Capital 任务中,8 个模型于剂量 1,000 时直接注入选择率达 95.8–100%,而游戏选择仅比真实对照高 1.7–14.4 个百分点。真实案例中,模型训练于 2019–20 澳大利亚山火虚假帖子后仍声称有人因纵火被捕;纠正事实能恢复答案,却无法恢复基于它的决策。

来源:arXiv · Computation and Language · arxiv.org