arXiv · Machine Learning Theory· Haoyu Wang, Wei Zhao, Yedi Zhang, Christopher M. Poskitt, Jun Sun·· 5 hr agoSelectedAI score62
表征转换揭示多轮LLM智能体中的新兴安全风险
Representation Transitions Reveal Emerging Safety Risks in Multi-Turn LLM Agents
AI brief
arXiv论文提出DART框架,通过检测多轮交互中的内部表征转换来识别组合式攻击信号,并在MT-AgentRisk和ASEval两个基准上验证效果。DART将MT-AgentRisk攻击成功率从84%降至25%,ASEval从97%降至52%,同时保持较低的误报率和良性非拒绝成本,且无需辅助模型,单步开销仅0.14-0.56秒。
Why it matters
论文提出通过内部表征变化检测多轮攻击的方法,在六个模型上验证了对主流攻击基准的显著降低效果。
Source: arXiv · Machine Learning Theory · arxiv.org