arXiv · Software Engineering· Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng Yuan·· 4 hr agoAI score33
Palette:面向 LLM 按需授权安全对齐放松的模块化、可控、高效框架
Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs
AI brief
论文提出 Palette,一个模块化、可控且高效的框架,可在授权目标域选择性放松 LLM 的拒绝行为,同时在其他场景保持标准安全。该方法通过多目标搜索识别拒绝方向,并以轻量适配将其内化到模型中,支持按域独立学习安全控制并通过参数合并组合,无需重训练即可实现多域按需授权。在四个安全基准、多个模型变体以及 LLM 与 VLM 上的实验显示,Palette 能实现精确安全控制且不牺牲通用能力。
Source: arXiv · Software Engineering · arxiv.org