热点事件持续更新
SSRFT:将安全对齐重构为安全角色内化
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月7日,arXiv(Artificial Intelligence,一手来源)报道了SSRFT(Supervised Safe-Role Fine-Tuning)方法,提出将大语言模型的安全对齐重构为对预定义安全角色的内化,而不是依赖显式的拒绝模式。该方法使用心理测量问题、少量越狱提示与安全角色描述构建SRQA数据集,并在此基础上合成并扩展与角色一致的回复,以训练模型在安全角色框架内作出回应。目前公开信息仅涉及该方法的基本思路与数据构建方式,尚无后续实验结果或第三方验证报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv报道SSRFT方法,以安全角色内化替代显式拒绝模式,并构建SRQA数据集。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Artificial IntelligenceSSRFT:把安全对齐重构为安全角色内化,超越拒绝模式
SSRFT(Supervised Safe-Role Fine-Tuning)把 LLM 安全对齐重构为预定义安全角色的内化,而非依赖显式拒绝模式。它用心理测量问题、少量 jailbreak 提示与安全角色描述构建 SRQA 数据集,合成并扩展角色一致回复。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。