arXiv · Machine Learning Theory· Elad David, Max Fomin·· 16 小时前AI 评分47
提示词如何提升激活探针在野外的恶意输入泛化检测
Prompted to Discriminate: Generalizing Malicious-Input Probes in the Wild
AI 导读
在用户回合后追加分类指令可让激活探针提升越狱与提示注入的分布外检测,单位置探针最高约 4 个 AUC 点,且收益来自分类格式而非具体类别名。该结论在 13 个安全基准、Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B 的留一数据集评估中成立,并延续到 attention、multi-max、MLP 等多位置池化探针。
来源:arXiv · Machine Learning Theory · arxiv.org