跳到正文
原文
arXiv · Computation and Language· Parisa Salmani, Peter R. Lewis·· 2 小时前精选AI 评分62

语言模型在长对抗对话中的安全性评估

Evaluating Language Model Safety Across Long Adversarial Conversations

AI 导读

研究评估三款开源指令微调模型在长对话中的安全性,由第二模型作为持续对抗用户测试两个有害提示。第一轮安全率85%-100%,到第11轮降至38%-61%,第101轮降至15%-44%,表明单轮安全不必然延续至持续对抗交互。

推荐理由

单轮安全率高但多轮对抗下显著下滑,提示长对话场景需要累积风险视角的评估与防护。

来源:arXiv · Computation and Language · arxiv.org