跳到正文
原文
arXiv · Information Retrieval· Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu, Ali Zain Kaimkhani, Minghong Fang·· 6 小时前AI 评分38

Safer Content or Firmer Refusals? VaccineBooster 混合扰动防御在有害微调下的对齐研究

Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

AI 导读

VaccineBooster 结合 embedding 扰动与权重梯度衰减,在 Llama-2-7B + BeaverTails 微调后攻击场景下取得最低 OpenAI moderation 分数 0.315;Booster-Only 变体保留最高拒绝率 50%。实验基于 10 条提示词与单次未播种运行,揭示嵌入扰动降有害内容、梯度衰减保显式拒绝行为的权衡。

来源:arXiv · Information Retrieval · arxiv.org