跳到正文
原文
arXiv · Computers and Society· Huy Nghiem, Sy-Tuyen Ho, Sarah Wiegreffe, Hal Daum\'e III·· 3 小时前AI 评分31

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

AI 导读

论文提出基于七个对齐相关激活方向的固定坐标系统,监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。

来源:arXiv · Computers and Society · arxiv.org