跳到正文
热点事件持续更新

RH-Detect:统一奖励黑客检测基准

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

RH-Detect 是一个面向奖励黑客检测的统一基准。它汇总了 11 个公开数据集中与奖励黑客相关的子集,共 92,761 行、6 类行为,并统一为通用 schema。研究者在 5,021 个开放式评测单元上,以零样本方式评测了 6 个现成模型作为检测器。最佳模型的 pooled AUROC 为 0.962,准确率超过 93%;但在 MALT 和 TRACE 两个多轮工具使用数据集上,最强 4 个模型的准确率低了 10.7–15.9 个百分点。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · Machine Learning Theory
    RH-Detect:统一奖励黑客检测基准

    RH-Detect 汇总 11 个公开数据集中与奖励黑客相关的子集,共 92,761 行、6 类行为,统一为通用 schema。在 5,021 个开放式评测单元上,6 个现成模型作为检测器零样本评测,最佳模型 pooled AUROC 0.962、准确率超 93%;但在 MALT 和 TRACE 两个多轮工具使用数据集上,最强 4 个模型准确率低 10.7–15.9 个百分点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。