跳到正文
热点事件持续更新

VaccineBooster混合防御对齐攻击研究

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,arXiv发表一手研究,探讨VaccineBooster混合防御在有害微调下的对齐表现。该方法结合embedding扰动与权重梯度衰减,在Llama-2-7B+BeaverTails微调后的攻击场景下取得最低OpenAI moderation分数0.315;Booster-Only变体保留最高拒绝率50%。实验基于10条提示词与单次未播种运行,揭示嵌入扰动降低有害内容、梯度衰减保持显式拒绝行为的权衡。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Information Retrieval
    Safer Content or Firmer Refusals? VaccineBooster 混合扰动防御在有害微调下的对齐研究

    VaccineBooster 结合 embedding 扰动与权重梯度衰减,在 Llama-2-7B + BeaverTails 微调后攻击场景下取得最低 OpenAI moderation 分数 0.315;Booster-Only 变体保留最高拒绝率 50%。实验基于 10 条提示词与单次未播种运行,揭示嵌入扰动降有害内容、梯度衰减保显式拒绝行为的权衡。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。