跳到正文
原文
arXiv · Artificial Intelligence· Michael Lee, Zhipeng Wei, Yue Dong, N. Benjamin Erichson·· 6 小时前AI 评分58

Divide and Inject:Agent 能否从片段重构间接提示注入?

Divide and Inject: Can Agents Reconstruct an Indirect Prompt Injection from Fragments?

AI 导读

论文提出 AdaLCPI 攻击,将恶意指令拆分为不完整片段嵌入检索内容,并通过重构提示让 Agent 组合。实验显示 AdaLCPI 宏平均攻击成功率 61.4%,显著高于 Trojan Hippo 风格的 32.8% 和 AgentVigil 的 30.0%。研究建议安全评估应测试 Agent 在需从片段重构恶意目标时的鲁棒性。

来源:arXiv · Artificial Intelligence · arxiv.org