跳到正文
热点事件持续更新

Palette:LLM 按需授权安全对齐松弛框架

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月7日,arXiv 软件工程方向发布一手论文,提出 Palette 框架。该框架面向大语言模型(LLM)的安全对齐问题,主打模块化、可控与高效,核心思路是按需授权:在经过授权的目标领域内选择性放松模型的拒绝行为,同时在其他场景维持标准安全策略。方法上,Palette 通过多目标搜索识别拒绝方向,并以轻量适配将其内化到模型中;它支持按域独立学习安全控制,再通过参数合并进行组合,从而无需重训练即可实现多域按需授权。实验覆盖四个安全基准、多个模型变体,并在 LLM 与 VLM 上验证,论文称 Palette 能实现精确的安全控制且不牺牲通用能力。目前公开信息仅见此一篇报道,尚无后续验证或争议。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Software Engineering
    Palette:面向 LLM 按需授权安全对齐放松的模块化、可控、高效框架

    论文提出 Palette,一个模块化、可控且高效的框架,可在授权目标域选择性放松 LLM 的拒绝行为,同时在其他场景保持标准安全。该方法通过多目标搜索识别拒绝方向,并以轻量适配将其内化到模型中,支持按域独立学习安全控制并通过参数合并组合,无需重训练即可实现多域按需授权。在四个安全基准、多个模型变体以及 LLM 与 VLM 上的实验显示,Palette 能实现精确安全控制且不牺牲通用能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。