Hot eventLive
DIBench:GUI移动智能体决策完整性基准
1 reports1 sources3 hr ago updated
Get the story
AI overview
2026年10月7日,arXiv Multiagent Systems 频道发布一手论文,提出 DIBench——一项面向 GUI 移动智能体的决策完整性评测基准。该基准覆盖 7 个商业应用与 3 个模拟应用、5 类任务,包含 1,000 条干净实例与 36,672 条注入实例。实验横跨 4 个智能体框架与 7 个基础模型,结果显示:基于完成度的评估会高估智能体可信度;欺骗注入可在无明显执行异常的情况下改变智能体选择并推高完成率;而检测、图像预处理与提示词提醒等常见防御手段带来的完整性提升并不一致。目前未见后续更新或争议报道。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
Oct 7, 2026
- arXiv · Multiagent SystemsDIBench:评测欺骗注入下 GUI 移动智能体的决策完整性
DIBench 是一项面向 GUI 移动智能体的决策完整性评测基准,覆盖 7 个商业与 3 个模拟应用、5 类任务,含 1,000 条干净与 36,672 条注入实例。实验横跨 4 个智能体框架与 7 个基础模型,发现基于完成度的评估会高估智能体可信度,欺骗注入可在无明显执行异常下改变选择并推高完成率。检测、图像预处理与提示词提醒等常见防御带来的完整性提升并不一致。
Heat trend
There is not enough continuous observation data to draw a trend yet.