arXiv · Computers and Society· Huy Nghiem, Sy-Tuyen Ho, Sarah Wiegreffe, Hal Daum\'e III·· 3 小时前AI 评分31
Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning
Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning
AI 导读
论文提出基于七个对齐相关激活方向的固定坐标系统,监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。
来源:arXiv · Computers and Society · arxiv.org