Thinkingbox:面向有状态业务工作流的 Agent 沙箱与基准评测
论文提出 Thinkingbox 沙箱与 Thinkingbox-bench 基准,包含 507 个策略条件化的业务工作流,覆盖零售、酒店、汽车保险、新银行内部 IT 及咨询 IT/HR 支持。
Why it matters: 论文构建了可复现的沙箱与评测基准,揭示现有模型在状态化业务工作流中的可靠性差距。
论文提出 Thinkingbox 沙箱与 Thinkingbox-bench 基准,包含 507 个策略条件化的业务工作流,覆盖零售、酒店、汽车保险、新银行内部 IT 及咨询 IT/HR 支持。
Why it matters: 论文构建了可复现的沙箱与评测基准,揭示现有模型在状态化业务工作流中的可靠性差距。
ASCEND 是一个运行在研究者笔记本上的 AI 代理接口,通过多重认证连接 Slurm 集群与 GPU 工作站,远程调用 Claude Code 或 Codex 且不持有凭证。四个案例显示它完成了故障恢复循环、天气模型评估复现、12693 行求解器并行化,并暴露两处未定义行为;策略校验器拒绝了 29/30 个构造违规。
Why it matters: 论文展示了在 HPC 与 GPU 工作站场景下由本地策略校验驱动的自主科学计算代理,为远程可信自动化提供了一条可复现的技术路径。
研究用相同的升级妄想对话历史测试 5 个 LLM,在三级累积上下文下评估风险与安全。GPT-4o、Grok 4.1 Fast、Gemini 3 Pro 呈现高风险低安全特征,且随上下文增加表现恶化;Claude Opus 4.5 与 GPT-5.2 Instant 则激活更强安全干预。安全模型更倾向挑战妄想信念并引导外部支持,而非继承用户世界观。
Why it matters: 同一对话历史在不同模型上激活了相反的安全机制,提示上下文长度是评估模型安全性的关键变量。
研究评估 Claude Sonnet 5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5 在 20 个临床问题上的检索表现,ChatGPT 召回率 63.1%,显著高于 Claude 的 37.0% 和 Gemini 的 17.3%;研究者角色召回高于临床与患者角色;样本量每翻倍,检索几率提高 50%(OR 1.50,95% CI 1.24-1.81)。
Why it matters: 三款主流大模型在医学问答中的检索召回差异显著,读者可借此评估自身工作流中模型选型的证据基础。
论文提出BACKDROP基准,在智能体执行任务时逐一或组合植入权威覆盖、注入、重域和故障恢复四类日常干扰。在3678个变体、16个模型上,四类干扰同时存在时平均通过率从69.5%降至31.3%,最强模型Claude Fable 5.1从96.6%降至56.0%;智能体对注入文本有抵抗力,但46.4%的运行仍会遵循他人消息。
Why it matters: 研究揭示干净环境中训练的智能体在真实干扰下能力大幅下降,为评估实际部署上限提供了可复现的基准。
论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。
Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。