arXiv · Artificial Intelligence· Benoit Dherin, Michael Munn, Xavier Gonzalvo, Adrian Goldwaser, Blaz Bratanic, Ananth Balashankar, Andrey Vlasov, Pinzhi Huang, Cecile Loge, Nicole Mitchell, Andre Fernandes, Trilok Acharya, Wendy Kan, Ziyue Wang, Hanna Mazzawi, Felipe Tiengo Ferreira, Mor Geva·· 7 小时前AI 评分55
Safety Operator:通过谱优化调节安全指令的表达强度
The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization
AI 导读
论文提出将 transformer 中的安全指令上下文 token 吸收为乘性算子,并通过调节其主特征值来控制安全指令对生成的影响强度。作者推导出带抑制权重的对比安全损失,在有害查询上强调安全指令、在无害查询上抑制它,从而在攻击成功率和过度拒绝率之间映射出 Pareto 改进关系。https://arxiv.org/abs/2609.36434
来源:arXiv · Artificial Intelligence · arxiv.org