Skip to content
Hot eventLive

HarnessSecurity-Bench:编码Agent安全机制评测基准

1 reports1 sources3 hr ago updated

Get the story

AI overview

2026年10月7日,arXiv 软件工程栏目发布一手论文,推出 HarnessSecurity-Bench 基准,对六款编码 Agent 框架的十类安全机制进行系统评测。研究覆盖 23 个任务、2,500 次试验和 81,155 次工具调用。结果显示,开启 auto-approve 会把攻击成功率从 29.2% 提升到 95.6%;网络隔离和只读模式虽能降低攻击效果,但会损失任务效用;命令白名单和黑名单在降低攻击效果的同时,分别带来小幅效用损失和增益。目前该事件仅有此篇报道,尚无后续验证或争议信息。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 7, 2026
  1. arXiv · Software Engineering
    HarnessSecurity-Bench 评测六款编码 Agent 框架的安全机制

    论文发布 HarnessSecurity-Bench,对六款编码 Agent 框架的十类安全机制进行系统评测。研究覆盖 23 个任务、2,500 次试验和 81,155 次工具调用,发现开启 auto-approve 会把攻击成功率从 29.2% 提升到 95.6%,网络隔离和只读模式虽降低攻击效果但损失任务效用,命令白名单和黑名单则在降低攻击效果的同时分别带来小幅效用损失和增益。

Heat trend

There is not enough continuous observation data to draw a trend yet.