热点事件持续更新
对抗训练下表征简洁性与电路规模解耦研究
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026-09-30,研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边;鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
最新结果显示高忠实度下鲁棒模型电路规模更小且更易被 SAE 分解。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · Artificial IntelligenceRepresentational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training
研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。