热点事件持续更新
RH-Detect:统一奖励黑客检测基准
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
RH-Detect 是一个面向奖励黑客检测的统一基准。它汇总了 11 个公开数据集中与奖励黑客相关的子集,共 92,761 行、6 类行为,并统一为通用 schema。研究者在 5,021 个开放式评测单元上,以零样本方式评测了 6 个现成模型作为检测器。最佳模型的 pooled AUROC 为 0.962,准确率超过 93%;但在 MALT 和 TRACE 两个多轮工具使用数据集上,最强 4 个模型的准确率低了 10.7–15.9 个百分点。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv · Machine Learning TheoryRH-Detect:统一奖励黑客检测基准
RH-Detect 汇总 11 个公开数据集中与奖励黑客相关的子集,共 92,761 行、6 类行为,统一为通用 schema。在 5,021 个开放式评测单元上,6 个现成模型作为检测器零样本评测,最佳模型 pooled AUROC 0.962、准确率超 93%;但在 MALT 和 TRACE 两个多轮工具使用数据集上,最强 4 个模型准确率低 10.7–15.9 个百分点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。