跳到正文
热点事件持续更新

对抗训练下表征简洁性与电路规模解耦研究

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边;鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Artificial Intelligence
    Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

    研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。