arXiv · Computers and Society· Jairo Gudi\~no-Rosero, Juan Ignacio Zambrano, Umberto Grandi, C\'esar A. Hidalgo·· 4 hr agoAI score41
推理如何增强基于 LLM 的共识生成对提示词注入的鲁棒性
Reasoning Enhances Robustness to Prompt Injection in LLM-Based Consensus
AI brief
研究评估了现成共识生成 LLM 面对提示词注入攻击的脆弱性,发现默认模型在意见分歧与赞同接近平衡、遭遇理性指令式修辞策略,以及攻击将共识导向亲联合派保守宣言而非亲独立左翼宣言时更易失效。结合 GPT-OSS-SafeGuard 注入检测、结构化意见表示与 GSPO 强化学习的流水线显著降低方向性失败,优于现有替代方案。
Source: arXiv · Computers and Society · arxiv.org