跳到正文
原文
arXiv · Multiagent Systems· Li Hu, Kanghua Mo, Yingbin Jin, Qingqing Ye, Haibo Hu·· 3 小时前AI 评分46

DIBench:评测欺骗注入下 GUI 移动智能体的决策完整性

DIBench: Benchmarking Decision Integrity of GUI-based Mobile Agents Under Deceptive Injections

AI 导读

DIBench 是一项面向 GUI 移动智能体的决策完整性评测基准,覆盖 7 个商业与 3 个模拟应用、5 类任务,含 1,000 条干净与 36,672 条注入实例。实验横跨 4 个智能体框架与 7 个基础模型,发现基于完成度的评估会高估智能体可信度,欺骗注入可在无明显执行异常下改变选择并推高完成率。检测、图像预处理与提示词提醒等常见防御带来的完整性提升并不一致。

来源:arXiv · Multiagent Systems · arxiv.org