arXiv · Information Retrieval· Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu, Ali Zain Kaimkhani, Minghong Fang·· 6 小时前AI 评分38
Safer Content or Firmer Refusals? VaccineBooster 混合扰动防御在有害微调下的对齐研究
Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning
AI 导读
VaccineBooster 结合 embedding 扰动与权重梯度衰减,在 Llama-2-7B + BeaverTails 微调后攻击场景下取得最低 OpenAI moderation 分数 0.315;Booster-Only 变体保留最高拒绝率 50%。实验基于 10 条提示词与单次未播种运行,揭示嵌入扰动降有害内容、梯度衰减保显式拒绝行为的权衡。
来源:arXiv · Information Retrieval · arxiv.org