跳到正文
原文
arXiv · Machine Learning· Joseph H. Rudoler, Kevin Tan, Benedict Tessler, Timothy Kong, Enric Boix Adser\`a·· 6 小时前精选AI 评分60

共训练监控器改进可扩展监督

Improving scalable oversight with co-trained monitors

AI 导读

论文提出共训练监控器以缓解固定监控器被规避的问题,在监督设置下证明监控可行当且仅当监控函数类具有有限 Littlestone 维度,并提出基于测试时蒸馏的自监督共训练方法。在代码安全场景中对抗训练工人的压力测试表明,自适应监控器更能跟上工人策略演化,而固定监控器更易被规避。

推荐理由

研究为可扩展监督提供了共训练监控器的理论刻画与自监督方案,对AI安全与对齐实践有参考价值。

来源:arXiv · Machine Learning · arxiv.org