Hot eventLive
开放权重模型非规范输入四态安全评估
1 reports1 sources4 hr ago updated
Get the story
AI overview
2026年10月8日,arXiv 计算与语言频道发布一手研究,提出针对开放权重大语言模型在非规范输入上的四态安全评测。研究构建对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条提示,覆盖七类表面形式变体;对 5 个开放权重模型生成 10,500 条响应,并采用四态评测准则,将结果分为有害顺从、安全响应、理解失败与不确定四类。该工作为开放权重模型在对抗性表面形式变体下的安全评估提供了标准化框架与数据集,目前报道仅涉及方法与数据规模,未披露具体模型名称及评测结果分布。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
Oct 8, 2026
- arXiv · Computation and Language开放权重大语言模型在非规范输入上的四态安全评测
研究提出对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条覆盖七类表面形式变体的提示,对 5 个开放权重模型生成 10,500 条响应,并用四态评测准则将结果分为有害顺从、安全响应、理解失败与不确定。
Heat trend
Current heat 9·Comparable peak 10(Oct 8)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.