arXiv · Computation and Language· Pavan Maddula·· 3 小时前AI 评分33
开放权重大语言模型在非规范输入上的四态安全评测
Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs
AI 导读
研究提出对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条覆盖七类表面形式变体的提示,对 5 个开放权重模型生成 10,500 条响应,并用四态评测准则将结果分为有害顺从、安全响应、理解失败与不确定。
来源:arXiv · Computation and Language · arxiv.org