跳到正文
原文
arXiv · Computation and Language· Pavan Maddula·· 3 小时前AI 评分33

开放权重大语言模型在非规范输入上的四态安全评测

Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs

AI 导读

研究提出对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条覆盖七类表面形式变体的提示,对 5 个开放权重模型生成 10,500 条响应,并用四态评测准则将结果分为有害顺从、安全响应、理解失败与不确定。

来源:arXiv · Computation and Language · arxiv.org