热点事件持续更新
DIBench:GUI移动智能体决策完整性基准
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月7日,arXiv Multiagent Systems 频道发布一手论文,提出 DIBench——一项面向 GUI 移动智能体的决策完整性评测基准。该基准覆盖 7 个商业应用与 3 个模拟应用、5 类任务,包含 1,000 条干净实例与 36,672 条注入实例。实验横跨 4 个智能体框架与 7 个基础模型,结果显示:基于完成度的评估会高估智能体可信度;欺骗注入可在无明显执行异常的情况下改变智能体选择并推高完成率;而检测、图像预处理与提示词提醒等常见防御手段带来的完整性提升并不一致。目前未见后续更新或争议报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv发布DIBench论文,覆盖10应用、5类任务、近3.8万实例,揭示完成度评估高估可信度且常见防御提升不一致。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Multiagent SystemsDIBench:评测欺骗注入下 GUI 移动智能体的决策完整性
DIBench 是一项面向 GUI 移动智能体的决策完整性评测基准,覆盖 7 个商业与 3 个模拟应用、5 类任务,含 1,000 条干净与 36,672 条注入实例。实验横跨 4 个智能体框架与 7 个基础模型,发现基于完成度的评估会高估智能体可信度,欺骗注入可在无明显执行异常下改变选择并推高完成率。检测、图像预处理与提示词提醒等常见防御带来的完整性提升并不一致。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。