热点事件持续更新
VaccineBooster混合防御对齐攻击研究
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026-09-30,arXiv发表一手研究,探讨VaccineBooster混合防御在有害微调下的对齐表现。该方法结合embedding扰动与权重梯度衰减,在Llama-2-7B+BeaverTails微调后的攻击场景下取得最低OpenAI moderation分数0.315;Booster-Only变体保留最高拒绝率50%。实验基于10条提示词与单次未播种运行,揭示嵌入扰动降低有害内容、梯度衰减保持显式拒绝行为的权衡。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · Information RetrievalSafer Content or Firmer Refusals? VaccineBooster 混合扰动防御在有害微调下的对齐研究
VaccineBooster 结合 embedding 扰动与权重梯度衰减,在 Llama-2-7B + BeaverTails 微调后攻击场景下取得最低 OpenAI moderation 分数 0.315;Booster-Only 变体保留最高拒绝率 50%。实验基于 10 条提示词与单次未播种运行,揭示嵌入扰动降有害内容、梯度衰减保显式拒绝行为的权衡。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。