Skip to content
arXiv · Artificial Intelligence· Jinghao Pang, Jitai Hao, Qiang Huang, Zhaochun Ren, Jun Yu·· 4 hr agoAI score30

SSRFT:把安全对齐重构为安全角色内化,超越拒绝模式

Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment

AI brief

SSRFT(Supervised Safe-Role Fine-Tuning)把 LLM 安全对齐重构为预定义安全角色的内化,而非依赖显式拒绝模式。它用心理测量问题、少量 jailbreak 提示与安全角色描述构建 SRQA 数据集,合成并扩展角色一致回复。

Source: arXiv · Artificial Intelligence · arxiv.org