跳到正文
原文
arXiv · Computers and Society· Ankit Srivastava, Debjyoti Paul·· 6 小时前精选AI 评分67

Agentic Commerce Bench:衡量智能体消费中的欺诈检测

Agentic Commerce Bench: Measuring Fraud Detection for Agents That Spend Money

AI 导读

作者提出智能体商务欺诈分类体系、包含 20 类欺诈的 Agentic Commerce Bench 基准以及开源检测器 gordonguard。在声明误报预算下干净流量标记率为 6.5%,20 类中有 8 类不优于随机;广泛使用的智能体安全扫描器在 4 类可观测欺诈上得分为零,而对对照型越狱检测得分为 1.0。中位支付金额 $0.007 表明人工审核成本是支付金额的 143 倍。

推荐理由

论文指出按身份核验无法发现合理超额收费,并给出可复现的基准与开源检测器。

来源:arXiv · Computers and Society · arxiv.org