arXiv · Artificial Intelligence· Michael Lee, Zhipeng Wei, Yue Dong, N. Benjamin Erichson·· 6 小时前AI 评分58
Divide and Inject:Agent 能否从片段重构间接提示注入?
Divide and Inject: Can Agents Reconstruct an Indirect Prompt Injection from Fragments?
AI 导读
论文提出 AdaLCPI 攻击,将恶意指令拆分为不完整片段嵌入检索内容,并通过重构提示让 Agent 组合。实验显示 AdaLCPI 宏平均攻击成功率 61.4%,显著高于 Trojan Hippo 风格的 32.8% 和 AgentVigil 的 30.0%。研究建议安全评估应测试 Agent 在需从片段重构恶意目标时的鲁棒性。
来源:arXiv · Artificial Intelligence · arxiv.org