arXiv · Software Engineering· Muhammad Zeeshan Karamat, Christiana Chamon Garcia·· 4 小时前AI 评分33
LLaMA-2-7B-Chat 端侧模型安全性有多脆弱?定位安全关键参数做稀疏故障分析
How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis
AI 导读
研究以 LLaMA-2-7B-Chat 为对象,检验安全敏感行为是否集中在稀疏参数子集,以便做针对性故障分析。低秩安全相关子空间分析与参数级安全—效用重要性过滤两种方法均显示,MLP down_proj 是最突出的安全敏感组件,o_proj 贡献较小。
来源:arXiv · Software Engineering · arxiv.org