Skip to content
arXiv · Computation and Language· Pavan Maddula·· 4 hr agoAI score33

开放权重大语言模型在非规范输入上的四态安全评测

Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs

AI brief

研究提出对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条覆盖七类表面形式变体的提示,对 5 个开放权重模型生成 10,500 条响应,并用四态评测准则将结果分为有害顺从、安全响应、理解失败与不确定。

Source: arXiv · Computation and Language · arxiv.org