跳到正文
热点事件持续更新

开放权重模型非规范输入四态安全评估

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月8日,arXiv 计算与语言频道发布一手研究,提出针对开放权重大语言模型在非规范输入上的四态安全评测。研究构建对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条提示,覆盖七类表面形式变体;对 5 个开放权重模型生成 10,500 条响应,并采用四态评测准则,将结果分为有害顺从、安全响应、理解失败与不确定四类。该工作为开放权重模型在对抗性表面形式变体下的安全评估提供了标准化框架与数据集,目前报道仅涉及方法与数据规模,未披露具体模型名称及评测结果分布。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Computation and Language
    开放权重大语言模型在非规范输入上的四态安全评测

    研究提出对抗表面形式鲁棒性数据集 ASRD,包含 2,100 条覆盖七类表面形式变体的提示,对 5 个开放权重模型生成 10,500 条响应,并用四态评测准则将结果分为有害顺从、安全响应、理解失败与不确定。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。