跳到正文
原文
Lilian Weng·· 2023-10-25AI 评分47

LLM 对抗攻击综述

Adversarial Attacks on LLMs

AI 导读

对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。

来源:Lilian Weng · lilianweng.github.io