Hot eventLive
Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning
1 reports1 sources3 hr ago updated
Get the story
AI overview
论文提出基于七个对齐相关激活方向的固定坐标系统,用于监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。
Generated from reports · updated 2 hr ago
Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Computers and SocietyTrait-space Monitoring for Emergent Misalignment During Supervised Finetuning
论文提出基于七个对齐相关激活方向的固定坐标系统,监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。
Heat trend
There is not enough continuous observation data to draw a trend yet.