跳到正文
原文
arXiv · Machine Learning Theory· Haoyu Wang, Wei Zhao, Yedi Zhang, Christopher M. Poskitt, Jun Sun·· 4 小时前精选AI 评分62

表征转换揭示多轮LLM智能体中的新兴安全风险

Representation Transitions Reveal Emerging Safety Risks in Multi-Turn LLM Agents

AI 导读

arXiv论文提出DART框架,通过检测多轮交互中的内部表征转换来识别组合式攻击信号,并在MT-AgentRisk和ASEval两个基准上验证效果。DART将MT-AgentRisk攻击成功率从84%降至25%,ASEval从97%降至52%,同时保持较低的误报率和良性非拒绝成本,且无需辅助模型,单步开销仅0.14-0.56秒。

推荐理由

论文提出通过内部表征变化检测多轮攻击的方法,在六个模型上验证了对主流攻击基准的显著降低效果。

来源:arXiv · Machine Learning Theory · arxiv.org