Lilian Weng·· 2023-10-25AI 评分47
LLM 对抗攻击综述
Adversarial Attacks on LLMs
AI 导读
对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。
来源:Lilian Weng · lilianweng.github.io