跳到正文
热点事件持续更新

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

论文提出基于七个对齐相关激活方向的固定坐标系统,用于监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Computers and Society
    Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

    论文提出基于七个对齐相关激活方向的固定坐标系统,监控 LoRA 微调过程中四款开源 7-9B 大语言模型的内部表征漂移。在 468 个检查点上,监控器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 及 SAE 特征基线。在第四数据集的良性-危险对照实验中,表征漂移同样出现在良性微调下,但 7D 特征仍能区分危险与良性运行。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。