Trust Is Not a Score:高风险 AI 智能体的运行时保证契约
论文提出 Runtime Assurance Contract(RAC),一种策略级形式化模式,绑定自主边界、组件资格、证据状态、转换策略、人工审核容量与非补偿门限。
Why it matters: 提出运行时保证契约的形式化框架,为高风险 AI 智能体的权限切换提供可验证机制。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
论文提出 Runtime Assurance Contract(RAC),一种策略级形式化模式,绑定自主边界、组件资格、证据状态、转换策略、人工审核容量与非补偿门限。
Why it matters: 提出运行时保证契约的形式化框架,为高风险 AI 智能体的权限切换提供可验证机制。
arXiv 论文提出一个由四种行为(隐瞒异议、内化答案、看到异议后重新考虑、纠正到正确答案)构成的简约模型,解释多智能体讨论何时提升准确率、何时陷入错误共识。模型指出讨论推翻错误多数的前提是隐瞒率 c 低于临界值 c* = γ/(γ+a),并通过贝叶斯方法从对话日志估计参数。在 HiddenBench 和 MedEInst 上,隐瞒率越高讨论收益越小;明确指示不隐瞒以及关闭推理都能提升收益。
Why it matters: 研究揭示了讨论机制何时优于多数投票,为设计多智能体系统提供了可量化的边界条件。
论文提出BACKDROP基准,在智能体执行任务时逐一或组合植入权威覆盖、注入、重域和故障恢复四类日常干扰。在3678个变体、16个模型上,四类干扰同时存在时平均通过率从69.5%降至31.3%,最强模型Claude Fable 5.1从96.6%降至56.0%;智能体对注入文本有抵抗力,但46.4%的运行仍会遵循他人消息。
Why it matters: 研究揭示干净环境中训练的智能体在真实干扰下能力大幅下降,为评估实际部署上限提供了可复现的基准。
研究者分析 73 个由 Lovable 生成的促销网站主页,用 DINOv3 嵌入与余弦相似度衡量设计多样性,发现 88% 的站点可归入 6 个可解释聚类,敏感性分析结果为 3-12 个聚类。
Why it matters: 论文用实证方法揭示 vibe coding 在共享提示环境下会收敛视觉设计,且主观感受与分布独特性不匹配。
PANDA 是去中心化多智能体架构,通过解耦集体通信与团队通信支持数千智能体、毫秒级组队与并发负载均衡;提供星型/链型/网状三种编排模式,并基于信任网络治理交互。在 HotPotQA 上,PANDA 以最高 8 倍效率匹配 SOTA 精度,并在现有系统失效时维持 100% 任务完成率。
Why it matters: 去中心化架构在 HotPotQA 上扩展到数千智能体并维持 100% 完成率,为多智能体系统的容错与编排策略选择提供了可迁移方法。
论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。
Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。
论文提出 TomasuLLM 运行时,在保持任务正确性的前提下按预测顺序提前执行 Agent 工具调用,并在验证后按轨迹顺序提交。在 SWE-bench Verified、Terminal-Bench 2.0 和 SWE-Marathon 上分别提速 1.31x、1.35x 和 1.27x,4010 条审计记录零误接受。https://arxiv.org/abs/2609.38201
Why it matters: 为长时工具延迟提供了乱序执行思路,读者可借此评估它对现有 Agent 工作流的潜在加速空间。
论文提出 URAI(Universal Robot-Agent Interface),由编程智能体根据任务意图构建可复用工具,执行智能体在观察后调用工具并完成完整动作,两者在反馈循环中协作。
Why it matters: 研究提出代码即策略的新分工方式,让前沿模型写工具并保留决策权,读者可借此评估机器人控制中工具复用与模型推理的权衡。
Talk2Agent 评测语音接口将人类口语指令传递给 LLM 电脑使用智能体的效果,基于 WildClawBench 和 OSWorld 构建口语任务版本,评测专用 ASR、音频大模型、上下文偏置和 LLM 本体修复等方法,并提出免执行、基于任务意图的评测框架,在 32 小时真实语音上 Pearson 相关性比 WER/CER 提升 0.246。
Why it matters: 为语音接口到文本智能体的信息保真度提供了可复现的评测框架和量化结果。
论文提出 Controlled In-Context Memory(CICM)基准,用于研究LLM在对话和Agent日志中跟踪与使用更新信息的能力。研究发现即使前沿推理模型也常出现 stale binding,即答案沿用旧值;开源模型中探针仍可恢复新值,说明是信息选择失败。
Why it matters: 提出CICM基准并定位注意力漂移机制,为理解模型为何使用过时信息提供了可迁移的分析框架。
SimEX 是一个两阶段自动研究框架,先在仿真中开放探索并构建鲁棒机器人工具箱,再通过少量物理试验同步修正仿真与工具箱。在毛巾折叠、条码扫描和盘子操作等真实任务上,编码智能体无需示教、仅 10 分钟真实交互即可习得技能。
Why it matters: 该框架把仿真与物理试错结合,让编码智能体在极少真实交互下习得机器人技能,为物理智能提供了一条可迁移的技术路径。
论文提出 Voice Retention / Representation Ratio 指标,用于审计 LLM 摘要中的代表性偏差。研究基于 2,586 条英德双语员工反馈,发现批评比表扬更可靠,但只被提及一次的关切在摘要中丢失率达 86%,短内容和纯德语内容丢失更严重。
Why it matters: 提出 Voice Retention Ratio 指标,揭示 LLM 摘要按流行度过滤员工反馈的代表性偏差。
研究团队发布 DrivingBench 基准,要求通用视觉语言模型通过摄像头画面直接控制丰田卡罗拉的转向和速度完成停车场锥桶路线。测试 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,Astra 在第二次尝试时完成全程,其他模型均未超过 50%;该基准强调推理延迟、监控与恢复能力,并公开了工具、提示词、地图与视频遥测数据。
Why it matters: 论文构建了真实车辆驾驶基准并给出可复现工具链,读者可借此评估主流视觉语言模型在具身控制任务上的实际能力边界。
研究者在德国圣诞老人电话热线嵌入2×2随机现场实验,将儿童通话随机分配至四种LLM语音代理。说服框架使亲社会愿望概率从11.6%升至45.7%;人格权威(Santa vs. Helper)近零效应,但Helper首分钟挂断率更高(65% vs. 39%)。结论为:当场景已赋予代理合法性时,说话方式比声称身份更能影响儿童顺从。
Why it matters: 真实场景中的儿童语音交互实验提供了说服框架与角色设定的相对权重,对设计面向儿童的产品有参考价值。
研究构建不可满足的 XOR 约束系统并将其翻译为不同实验室的科学报告,考察模型在约束拟合与生物学预期之间的选择。
Why it matters: 同一组约束在科学散文与形式化表述下模型选择差异显著,提示科学验证的可靠性部分取决于模型如何理解可比性。
论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。
Why it matters: 背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。
PrivMeSA通过本地Agent管理问诊并咨询远程专家,利用强化学习在任务精度与直接披露、基于注册表的重识别风险之间取得平衡,同时以本地课程记忆蒸馏已完成的咨询,使后续病例无需再次远程调用即可复用专家知识。
Why it matters: 通过本地-远程协作与强化学习,在保留远程专家能力的同时把患者信息披露从98%降至0.2%,为本地部署医疗Agent提供可复用的隐私保护路径。
该研究提出让同一冻结模型在同一版本 harness 上先作为求解器执行任务、再作为提议者直接编辑自身 harness 的递归自改进框架。进化批次覆盖五个不同领域基准,训练与验证任务严格分离,并在五个分布外基准上评估。
Why it matters: 同一模型在多任务分布上自我迭代 harness,在分布外基准上超越 Codex,为递归自我改进提供了一条可复现的路径。
arXiv论文 arXiv:2609.38296 模拟两个LLM智能体对话,影响力智能体试图使目标智能体信念极端化,发现共振路径比说服路径更强,且共振会传播到相关信念。
Why it matters: 研究揭示LLM智能体间可通过共振与说服相互激进化,对多智能体生态的安全边界提出警示。