Palette:LLM 按需授权安全对齐松弛框架
Get the story
2026年10月7日,arXiv 软件工程方向发布一手论文,提出 Palette 框架。该框架面向大语言模型(LLM)的安全对齐问题,主打模块化、可控与高效,核心思路是按需授权:在经过授权的目标领域内选择性放松模型的拒绝行为,同时在其他场景维持标准安全策略。方法上,Palette 通过多目标搜索识别拒绝方向,并以轻量适配将其内化到模型中;它支持按域独立学习安全控制,再通过参数合并进行组合,从而无需重训练即可实现多域按需授权。实验覆盖四个安全基准、多个模型变体,并在 LLM 与 VLM 上验证,论文称 Palette 能实现精确的安全控制且不牺牲通用能力。目前公开信息仅见此一篇报道,尚无后续验证或争议。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
- arXiv · Software EngineeringPalette:面向 LLM 按需授权安全对齐放松的模块化、可控、高效框架
论文提出 Palette,一个模块化、可控且高效的框架,可在授权目标域选择性放松 LLM 的拒绝行为,同时在其他场景保持标准安全。该方法通过多目标搜索识别拒绝方向,并以轻量适配将其内化到模型中,支持按域独立学习安全控制并通过参数合并组合,无需重训练即可实现多域按需授权。在四个安全基准、多个模型变体以及 LLM 与 VLM 上的实验显示,Palette 能实现精确安全控制且不牺牲通用能力。
Heat trend
Current heat 9·Comparable peak 10(Oct 7)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.