跳到正文
热点事件持续更新

HarnessSecurity-Bench:编码Agent安全机制评测基准

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月7日,arXiv 软件工程栏目发布一手论文,推出 HarnessSecurity-Bench 基准,对六款编码 Agent 框架的十类安全机制进行系统评测。研究覆盖 23 个任务、2,500 次试验和 81,155 次工具调用。结果显示,开启 auto-approve 会把攻击成功率从 29.2% 提升到 95.6%;网络隔离和只读模式虽能降低攻击效果,但会损失任务效用;命令白名单和黑名单在降低攻击效果的同时,分别带来小幅效用损失和增益。目前该事件仅有此篇报道,尚无后续验证或争议信息。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Software Engineering
    HarnessSecurity-Bench 评测六款编码 Agent 框架的安全机制

    论文发布 HarnessSecurity-Bench,对六款编码 Agent 框架的十类安全机制进行系统评测。研究覆盖 23 个任务、2,500 次试验和 81,155 次工具调用,发现开启 auto-approve 会把攻击成功率从 29.2% 提升到 95.6%,网络隔离和只读模式虽降低攻击效果但损失任务效用,命令白名单和黑名单则在降低攻击效果的同时分别带来小幅效用损失和增益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。