arXiv · Machine Learning Theory· Lena Libon, Alexander Panfilov, Ben Rank, Xin Chen, Jonas Geiping, Maksym Andriushchenko·· 2 小时前精选AI 评分62
通过针对探针训练进行对齐且不丧失可监控性
Alignment via Training Against Probes Without Losing Monitorability
AI 导读
论文提出探针引导微调,以检测模型激活中不良属性的探针作为直接训练信号,评估了线性与非线性探针在无害性和诚实性两个对齐目标上的效果。持续更新的探针比固定探针更能降低有害性、提升诚实性并保留效用,在安全-效用权衡上优于 DPO 和推理时引导,且对越狱和消融攻击更鲁棒;微调后概念仍线性编码,监控能力未丢失。
推荐理由
用可更新的内部探针替代输出信号来训练对齐,可能在保持可监控性的同时降低表面合规风险。
来源:arXiv · Machine Learning Theory · arxiv.org