跳到正文
热点事件持续更新

SSRFT:将安全对齐重构为安全角色内化

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月7日,arXiv(Artificial Intelligence,一手来源)报道了SSRFT(Supervised Safe-Role Fine-Tuning)方法,提出将大语言模型的安全对齐重构为对预定义安全角色的内化,而不是依赖显式的拒绝模式。该方法使用心理测量问题、少量越狱提示与安全角色描述构建SRQA数据集,并在此基础上合成并扩展与角色一致的回复,以训练模型在安全角色框架内作出回应。目前公开信息仅涉及该方法的基本思路与数据构建方式,尚无后续实验结果或第三方验证报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Artificial Intelligence
    SSRFT:把安全对齐重构为安全角色内化,超越拒绝模式

    SSRFT(Supervised Safe-Role Fine-Tuning)把 LLM 安全对齐重构为预定义安全角色的内化,而非依赖显式拒绝模式。它用心理测量问题、少量 jailbreak 提示与安全角色描述构建 SRQA 数据集,合成并扩展角色一致回复。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。