arXiv · Artificial Intelligence· Jinghao Pang, Jitai Hao, Qiang Huang, Zhaochun Ren, Jun Yu·· 3 小时前AI 评分30
SSRFT:把安全对齐重构为安全角色内化,超越拒绝模式
Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment
AI 导读
SSRFT(Supervised Safe-Role Fine-Tuning)把 LLM 安全对齐重构为预定义安全角色的内化,而非依赖显式拒绝模式。它用心理测量问题、少量 jailbreak 提示与安全角色描述构建 SRQA 数据集,合成并扩展角色一致回复。
来源:arXiv · Artificial Intelligence · arxiv.org