Skip to content
arXiv · Artificial Intelligence· Zhankai Ye, Yanning Wang, Yukai Jin, Bo Mei, Fangyi Li, Wei Wang, Shangqian Gao, Xin Liu·· 4 hr agoAI score55

叙事包裹如何影响大语言模型拒绝:跨语言基准与防御方法

How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

AI brief

论文提出 GUISE 基准并研究叙事包裹对模型拒绝的影响,Qwen3-1.7B 在英文、现代中文和文言文中的攻击成功率分别为 89.4%、93.0% 和 95.7%。作者提出 AXIS 防御方法,在 Qwen3-1.7B、Qwen3-4B 和 GLM-4-9B 上取得对比方法中最高的安全性与可用性综合得分。

Source: arXiv · Artificial Intelligence · arxiv.org