arXiv · Machine Learning Theory· Junwei Quan, Evgenii Opryshko, Rohan Subramani, Igor Gilitschenski·· 3 小时前AI 评分44
RH-Detect:统一奖励黑客检测基准
RH-Detect: A Unified Benchmark for Reward Hacking Detection
AI 导读
RH-Detect 汇总 11 个公开数据集中与奖励黑客相关的子集,共 92,761 行、6 类行为,统一为通用 schema。在 5,021 个开放式评测单元上,6 个现成模型作为检测器零样本评测,最佳模型 pooled AUROC 0.962、准确率超 93%;但在 MALT 和 TRACE 两个多轮工具使用数据集上,最强 4 个模型准确率低 10.7–15.9 个百分点。
来源:arXiv · Machine Learning Theory · arxiv.org