Skip to content
arXiv · Software Engineering· Muhammad Zeeshan Karamat, Christiana Chamon Garcia·· 4 hr agoAI score33

LLaMA-2-7B-Chat 端侧模型安全性有多脆弱?定位安全关键参数做稀疏故障分析

How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis

AI brief

研究以 LLaMA-2-7B-Chat 为对象,检验安全敏感行为是否集中在稀疏参数子集,以便做针对性故障分析。低秩安全相关子空间分析与参数级安全—效用重要性过滤两种方法均显示,MLP down_proj 是最突出的安全敏感组件,o_proj 贡献较小。

Source: arXiv · Software Engineering · arxiv.org