arXiv · Computers and Society· Toluwani Aremu, Manit Baser, Mohan Gurusamy, Nils Lukas, Dinil Mon Divakaran·· 16 小时前AI 评分40
开放权重 LLM 滥用检测中触发标记机制的脆弱性
The Fragility of Trigger-Tag Mechanisms for Misuse Detection in Open-Weight LLMs
AI 导读
论文将开放权重 LLM 的触发标记机制分为 token 级与权重级两类,并提出统一攻击框架 Untag,以钓鱼内容生成为案例展开评估。结果显示,现有触发标记机制在攻击者能改写输出或修改开放权重时完全失效,因此不应被视为稳健的滥用检测手段。研究认为这些机制在受控环境下虽可提供证据,但面对对抗性攻击缺乏鲁棒性。
来源:arXiv · Computers and Society · arxiv.org