arXiv · Computation and Language· Parisa Salmani, Peter R. Lewis·· 8 hr agoSelectedAI score62
语言模型在长对抗对话中的安全性评估
Evaluating Language Model Safety Across Long Adversarial Conversations
AI brief
研究评估三款开源指令微调模型在长对话中的安全性,由第二模型作为持续对抗用户测试两个有害提示。第一轮安全率85%-100%,到第11轮降至38%-61%,第101轮降至15%-44%,表明单轮安全不必然延续至持续对抗交互。
Why it matters
单轮安全率高但多轮对抗下显著下滑,提示长对话场景需要累积风险视角的评估与防护。
Source: arXiv · Computation and Language · arxiv.org