Skip to content
Hot eventLive

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

1 reports1 sources3 hr ago updated

Get the story

AI overview

论文提出基于七个对齐相关激活方向的固定坐标系统,用于监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。

Generated from reports · updated 2 hr ago

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Computers and Society
    Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

    论文提出基于七个对齐相关激活方向的固定坐标系统,监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。

Heat trend

There is not enough continuous observation data to draw a trend yet.