跳到正文
原文
arXiv · Information Retrieval· Jiaqi Xue, Mengxin Zheng, Yebowen Hu, Fei Liu, Xun Chen, Qian Lou·· 6 小时前精选AI 评分65

BadRAG:识别大语言模型检索增强生成中的漏洞

BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models

AI 导读

论文 BadRAG 指出攻击者可通过向知识库注入恶意段落,并利用触发词引导 RAG 检索,从而操控 LLM 响应。实验显示,仅注入 10 条恶意段落(占外部语料的 0.04%)即可实现 98.2% 的检索成功率,并将含触发词查询的负面响应率从 0.22% 提升至 72%。原文链接:https://arxiv.org/abs/2406.00083

推荐理由

BadRAG 揭示了 RAG 系统在引用外部知识库时可能因恶意注入段落被触发,为依赖检索的 LLM 应用提供了新的安全威胁视角。

来源:arXiv · Information Retrieval · arxiv.org