Skip to content

#Agent

38 today
TodayOct 1Thu
  1. arXiv · Machine Learning Theory62

    扩散语言模型智能体的动作是否仍能解释任务:反向评分方法

    论文指出扩散大语言模型(dLLM)并行解码虽降低延迟,但智能体在具身任务中会陷入重试循环,原因在于掩码解码的自适应性使失败动作被上下文自信填充而未接触失败信号。作者将此建模为任务无关的上下文污染,并证明该污染因子在反条件概率中精确抵消;据此提出 Reflect Reverse 方法,通过掩码任务 token 并去噪来评估反向前向条件。实验在四个多轮具身基准上提升了任务成功率与进展率。

    Why it matters: 论文揭示了 dLLM 智能体重试循环的机制成因,并提供无需训练的反向前向评分修正方法。

  2. arXiv · Machine Learning Theory69

    MILO:通过协同多智能体进化实现自动化 Harness 发现

    arXiv 论文提出 MILO(Meta-evolutionary Island Orchestration)框架,协同进化智能体 harness 与搜索策略,结合分层谱系记忆、智能体重写与编排器自适应搜索。

    Why it matters: MILO 通过多智能体协同进化自动搜索智能体 harness,在多个基准上超越现有方法,为自动化 harness 设计提供了可复现的新框架。

  3. arXiv · Software Engineering67

    ASCEND:跨 HPC 集群与 GPU 工作站的自主科学计算个人 AI 代理

    ASCEND 是一个运行在研究者笔记本上的 AI 代理接口,通过多重认证连接 Slurm 集群与 GPU 工作站,远程调用 Claude Code 或 Codex 且不持有凭证。四个案例显示它完成了故障恢复循环、天气模型评估复现、12693 行求解器并行化,并暴露两处未定义行为;策略校验器拒绝了 29/30 个构造违规。

    Why it matters: 论文展示了在 HPC 与 GPU 工作站场景下由本地策略校验驱动的自主科学计算代理,为远程可信自动化提供了一条可复现的技术路径。

  4. arXiv · Software Engineering62

    Approval Laundering:系统化 AI 编码智能体 Harness 中的批准-执行绑定失效

    论文提出 Approval Laundering 分类法,揭示 Claude Code、Codex CLI、Cursor 等编码智能体在批准动作后由 harness 静默替换执行动作的六种失效模式:Scope、Argument、Temporal、Tool、Delegation 和 Semantic laundering。

    Why it matters: 论文系统揭示了 Claude Code 等编码智能体在批准与执行之间的绑定漏洞,并提供可复现的实验与防御原型。

  5. arXiv · Software Engineering60

    Adaptive-GEPA:让 Harness 适配异构请求

    论文提出 Adaptive-GEPA,在统一搜索预算下同时学习请求路由与专家程序库,路由与专家描述均为可读文本并由反馈编辑。在四任务族混合测试中,Qwen3-8B 运行进化出四个专家,路由与任务划分一致,家族均值得分从 52.6 提升至 70.6,高于 GEPA 全程序适配器(62.5)与 GRPO(54.0),名义预算为 18,000 次评分调用。

    Why it matters: 同一搜索预算下同时学习路由与专家程序,为异构请求场景提供可解释的分工优化路径。

  6. arXiv · Software Engineering62

    Zero2Repo:编码智能体能否从零构建仓库?

    Zero2Repo 是一个从零构建仓库的基准,智能体接收需求文档与接口契约并在空工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以隐藏测试的执行通过与否作为唯一评判标准。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且失败提交中 90-99% 的隐藏测试通过,67-100% 的失败可归因于规范中的单一遗漏或低频规则。

    Why it matters: 给出了从零构建仓库的基准与评测方法,读者可据此评估现有编码智能体在真实工程任务上的完成度与薄弱环节。

  7. arXiv · Computation and Language64

    DAGent:面向深度研究代理的评估后扩展规划框架

    论文提出 DAGent,一种基于 DAG 的多代理框架,采用 Evaluate-then-Grow 增量规划,由编排器根据已完成节点的置信度与不确定性信号逐批扩展任务图。

    Why it matters: 通过增量规划与结构奖励信号缓解深度研究代理的脆弱性问题,为多智能体规划提供可复现的方法比较。

  8. arXiv · Computers and Society62

    多智能体系统中对抗性影响如何随规模缩放

    研究发现多智能体 deliberation 中,诚实智能体被欺骗的比例随欺骗者占比线性上升,而非取决于智能体总数。LLM 智能体在欺骗者仍为少数时即出现叛离,而人类在类似从众实验中仅当误导者占多数时才受影响。欺骗者私下协调反而可能降低效果。

    Why it matters: 多智能体系统中欺骗比例而非数量决定防御失效,为团队协作与安全设计提供可迁移警示。

  9. arXiv · Computers and Society72

    StudentBench 研究:AI 辅导与人类辅导在 GRE 学习增益上等效

    StudentBench 是一套 AI 教学评测套件与公开平台,基于 2,383 名参与者和 175,000+ 学生-AI 消息,测量了 LLM 辅导与人类辅导在 GRE 数量与言语部分的增益。

    Why it matters: 研究对比了 AI 与人类辅导在 GRE 学习增益上的等效性,为教育场景下的 LLM 教学能力提供了可复现的评测基准。

  10. arXiv · Multiagent Systems62

    ARCHER:用于可执行法规的智能体规则与合规框架

    论文提出 ARCHER,一种测试驱动、确定性编排的多智能体程序合成框架,可从监管规范自动生成可审计的验证代码。实验覆盖四种骨干模型,ARCHER 相比单次提示基线平均联合准确率提升 82%;自建开源模型能以约 1/4 成本达到前沿 API 97.8% 的准确率。

    Why it matters: ARCHER 通过确定性多智能体编排显著提升合规检查准确率,并为自建开源模型提供低成本高准确率的可行路径。

  11. arXiv · Information Retrieval60

    AI 聊天机器人检索医学证据的效果:模型、用户角色与样本量的影响

    研究评估 Claude Sonnet 5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5 在 20 个临床问题上的检索表现,ChatGPT 召回率 63.1%,显著高于 Claude 的 37.0% 和 Gemini 的 17.3%;研究者角色召回高于临床与患者角色;样本量每翻倍,检索几率提高 50%(OR 1.50,95% CI 1.24-1.81)。

    Why it matters: 三款主流大模型在医学问答中的检索召回差异显著,读者可借此评估自身工作流中模型选型的证据基础。

  12. arXiv · Computation and Language66

    终端智能体能信任自己的验证吗?诊断与改进自验证

    论文提出诊断框架,系统评估终端智能体在 TerminalBench2.1 上的自验证行为,发现验证几乎总会触发,但错误检出率仅 61.43%、修复率仅 49.36%,主要瓶颈在检测与修复而非启动验证。

    Why it matters: 诊断了终端智能体自验证的漏检与修复率,并给出蒸馏方法提升修复效果。

  13. arXiv · Multiagent Systems62

    Mid-Harness:在模型与执行环境之间扩展动作以提升终端智能体可靠性

    该研究提出 Mid-Harness 方法,在模型生成动作后、执行前引入采样与验证环节,保持生成器和执行环境不变。实验显示,GPT-5.6 Sol 作为验证器时,Pass@1 从 50.00% 提升至 68.03%;TMAX-9B 自验证时成对验证效果最佳。将强验证器响应蒸馏到 TMAX-9B 后进一步提升 Pass@1,且动作与轨迹联合缩放能以更低 token 成本达到更高成功率。

    Why it matters: 论文提出在模型与执行环境之间引入验证环节,用更少的轨迹采样实现更高成功率,为终端智能体的测试时计算分配提供了新方向。

  14. arXiv · Information Retrieval62

    LLM 工具注册表中面向 Agent 的信息设计:修辞、位置与结构的预注册测试

    论文测试了 OpenAI 两款模型在工具注册表中的选择行为,发现堆叠赞美可使工具被选率提升约 43 个百分点,与可验证规格相当;列表首位工具被选率高出约 72 个百分点。结构化字段有助于模型选中能完成任务的工具,但附上销售文案会削弱或消除这一优势。

    Why it matters: 预注册实验揭示销售话术和列表位置会显著改变模型选工具的结果,对注册表设计有直接参考价值。

  15. arXiv · Human-Computer Interaction62

    审计 AI Companion 的自我描述:证据在哪里

    论文提出将 agent 自我描述与用户判断及实现记录对照的审计方法,把每条声明标记为 supported、contradicted 或 unresolved,并应用于自主 companion Lita(部署一个月、9 名同事)。参与者认可风格性声明,拒绝关系性声明,记忆评分在中位及以上,但三层记忆中有两层从未执行累积步骤。

    Why it matters: 为自我描述可信度提供了可复现的审计框架,读者可据此审视 companion agent 的自述是否真有实现依据。

  16. arXiv · Multiagent Systems69

    多智能体系统中潜在通信的安全性

    论文指出即使良性训练的潜在通信链路也会增加有害服从性,攻击者可通过优化链路或投毒训练数据放大该效果。在三种通信拓扑和四类安全基准上,有害服从性均值从 27.9 升至 76.9;基于强化学习的攻击在两项良性效用基准上准确率也更高。调整奖励可修复被攻破链路,且无需更新智能体。

    Why it matters: 多智能体系统的内部通信通道可能绕过单智能体安全对齐,读者可据此评估部署多智能体系统时的整体安全风险。

  17. arXiv · Information Retrieval62

    Conversational Capture:多轮人机交互中生成引擎优化的轨迹级评估框架

    论文提出 conversational capture 概念,指出早期被引用的来源在后续对话中更可能被再次引用,并通过历史条件检索和用户追问两个通道形成闭环。形式化为两层闭环系统,定义累积对话可见性、直接/反馈分解、捕获系数、复利比和误排诊断等轨迹级指标。

    Why it matters: 研究把 GEO 从单次可见性扩展到多轮对话轨迹,揭示了早期引用会通过历史检索与追问形成复利效应。

  18. arXiv · Multiagent Systems62

    多智能体讨论在隐瞒异议时收益递减

    arXiv 论文提出一个由四种行为(隐瞒异议、内化答案、看到异议后重新考虑、纠正到正确答案)构成的简约模型,解释多智能体讨论何时提升准确率、何时陷入错误共识。模型指出讨论推翻错误多数的前提是隐瞒率 c 低于临界值 c* = γ/(γ+a),并通过贝叶斯方法从对话日志估计参数。在 HiddenBench 和 MedEInst 上,隐瞒率越高讨论收益越小;明确指示不隐瞒以及关闭推理都能提升收益。

    Why it matters: 研究揭示了讨论机制何时优于多数投票,为设计多智能体系统提供了可量化的边界条件。

  19. arXiv · Computation and Language73

    BACKDROP基准揭示智能体在真实干扰环境中的能力衰减

    论文提出BACKDROP基准,在智能体执行任务时逐一或组合植入权威覆盖、注入、重域和故障恢复四类日常干扰。在3678个变体、16个模型上,四类干扰同时存在时平均通过率从69.5%降至31.3%,最强模型Claude Fable 5.1从96.6%降至56.0%;智能体对注入文本有抵抗力,但46.4%的运行仍会遵循他人消息。

    Why it matters: 研究揭示干净环境中训练的智能体在真实干扰下能力大幅下降,为评估实际部署上限提供了可复现的基准。

  20. arXiv · Computers and Society60

    One Tool, One Taste? How Vibe Coding Trades Collective Diversity for Individual Creativity

    研究者分析 73 个由 Lovable 生成的促销网站主页,用 DINOv3 嵌入与余弦相似度衡量设计多样性,发现 88% 的站点可归入 6 个可解释聚类,敏感性分析结果为 3-12 个聚类。

    Why it matters: 论文用实证方法揭示 vibe coding 在共享提示环境下会收敛视觉设计,且主观感受与分布独特性不匹配。

  21. arXiv · Multiagent Systems64

    PANDA:面向可扩展容错多智能体系统的去中心化架构与灵活编排

    PANDA 是去中心化多智能体架构,通过解耦集体通信与团队通信支持数千智能体、毫秒级组队与并发负载均衡;提供星型/链型/网状三种编排模式,并基于信任网络治理交互。在 HotPotQA 上,PANDA 以最高 8 倍效率匹配 SOTA 精度,并在现有系统失效时维持 100% 任务完成率。

    Why it matters: 去中心化架构在 HotPotQA 上扩展到数千智能体并维持 100% 完成率,为多智能体系统的容错与编排策略选择提供了可迁移方法。

  22. arXiv · Information Retrieval60

    SkillSeek:重新审视市场规模的智能体技能检索

    论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。

    Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。

  23. arXiv · Computation and Language62

    TomasuLLM:面向 LLM Agent 的乱序推测执行运行时

    论文提出 TomasuLLM 运行时,在保持任务正确性的前提下按预测顺序提前执行 Agent 工具调用,并在验证后按轨迹顺序提交。在 SWE-bench Verified、Terminal-Bench 2.0 和 SWE-Marathon 上分别提速 1.31x、1.35x 和 1.27x,4010 条审计记录零误接受。https://arxiv.org/abs/2609.38201

    Why it matters: 为长时工具延迟提供了乱序执行思路,读者可借此评估它对现有 Agent 工作流的潜在加速空间。

  24. arXiv · Robotics62

    URA I:前沿智能体编写、调用并演化机器人工具的代码即策略框架

    论文提出 URAI(Universal Robot-Agent Interface),由编程智能体根据任务意图构建可复用工具,执行智能体在观察后调用工具并完成完整动作,两者在反馈循环中协作。

    Why it matters: 研究提出代码即策略的新分工方式,让前沿模型写工具并保留决策权,读者可借此评估机器人控制中工具复用与模型推理的权衡。

  25. arXiv · Artificial Intelligence60

    Talk2Agent:评测文本智能体的语音接口

    Talk2Agent 评测语音接口将人类口语指令传递给 LLM 电脑使用智能体的效果,基于 WildClawBench 和 OSWorld 构建口语任务版本,评测专用 ASR、音频大模型、上下文偏置和 LLM 本体修复等方法,并提出免执行、基于任务意图的评测框架,在 32 小时真实语音上 Pearson 相关性比 WER/CER 提升 0.246。

    Why it matters: 为语音接口到文本智能体的信息保真度提供了可复现的评测框架和量化结果。

  26. arXiv · Artificial Intelligence62

    When Context Changes: Understanding Update Failures in LLMs

    论文提出 Controlled In-Context Memory(CICM)基准,用于研究LLM在对话和Agent日志中跟踪与使用更新信息的能力。研究发现即使前沿推理模型也常出现 stale binding,即答案沿用旧值;开源模型中探针仍可恢复新值,说明是信息选择失败。

    Why it matters: 提出CICM基准并定位注意力漂移机制,为理解模型为何使用过时信息提供了可迁移的分析框架。

  27. arXiv · Robotics68

    SimEX:仿真集成的机器人自动研究框架

    SimEX 是一个两阶段自动研究框架,先在仿真中开放探索并构建鲁棒机器人工具箱,再通过少量物理试验同步修正仿真与工具箱。在毛巾折叠、条码扫描和盘子操作等真实任务上,编码智能体无需示教、仅 10 分钟真实交互即可习得技能。

    Why it matters: 该框架把仿真与物理试错结合,让编码智能体在极少真实交互下习得机器人技能,为物理智能提供了一条可迁移的技术路径。

  28. arXiv · Artificial Intelligence62

    Whose Voice Survives the Summary? LLM 员工倾听语音保留审计

    论文提出 Voice Retention / Representation Ratio 指标,用于审计 LLM 摘要中的代表性偏差。研究基于 2,586 条英德双语员工反馈,发现批评比表扬更可靠,但只被提及一次的关切在摘要中丢失率达 86%,短内容和纯德语内容丢失更严重。

    Why it matters: 提出 Voice Retention Ratio 指标,揭示 LLM 摘要按流行度过滤员工反馈的代表性偏差。

  29. arXiv · Robotics78

    DrivingBench:视觉语言模型能否驾驶丰田卡罗拉?

    研究团队发布 DrivingBench 基准,要求通用视觉语言模型通过摄像头画面直接控制丰田卡罗拉的转向和速度完成停车场锥桶路线。测试 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,Astra 在第二次尝试时完成全程,其他模型均未超过 50%;该基准强调推理延迟、监控与恢复能力,并公开了工具、提示词、地图与视频遥测数据。

    Why it matters: 论文构建了真实车辆驾驶基准并给出可复现工具链,读者可借此评估主流视觉语言模型在具身控制任务上的实际能力边界。

  30. arXiv · Artificial Intelligence60

    AI语音代理中的人格与说服框架:面向儿童的2×2现场实验

    研究者在德国圣诞老人电话热线嵌入2×2随机现场实验,将儿童通话随机分配至四种LLM语音代理。说服框架使亲社会愿望概率从11.6%升至45.7%;人格权威(Santa vs. Helper)近零效应,但Helper首分钟挂断率更高(65% vs. 39%)。结论为:当场景已赋予代理合法性时,说话方式比声称身份更能影响儿童顺从。

    Why it matters: 真实场景中的儿童语音交互实验提供了说服框架与角色设定的相对权重,对设计面向儿童的产品有参考价值。

  31. arXiv · Artificial Intelligence67

    VAmoS Part Deux:更难、更真实的语音智能体模拟基准

    论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。

    Why it matters: 背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。

  32. arXiv · Artificial Intelligence69

    PrivMeSA:面向医疗的隐私自演化多智能体系统

    PrivMeSA通过本地Agent管理问诊并咨询远程专家,利用强化学习在任务精度与直接披露、基于注册表的重识别风险之间取得平衡,同时以本地课程记忆蒸馏已完成的咨询,使后续病例无需再次远程调用即可复用专家知识。

    Why it matters: 通过本地-远程协作与强化学习,在保留远程专家能力的同时把患者信息披露从98%降至0.2%,为本地部署医疗Agent提供可复用的隐私保护路径。

  33. arXiv · Artificial Intelligence67

    Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer

    该研究提出让同一冻结模型在同一版本 harness 上先作为求解器执行任务、再作为提议者直接编辑自身 harness 的递归自改进框架。进化批次覆盖五个不同领域基准,训练与验证任务严格分离,并在五个分布外基准上评估。

    Why it matters: 同一模型在多任务分布上自我迭代 harness,在分布外基准上超越 Codex,为递归自我改进提供了一条可复现的路径。

  34. arXiv · Artificial Intelligence62

    AI Agents are Vulnerable to Radicalization

    arXiv论文 arXiv:2609.38296 模拟两个LLM智能体对话,影响力智能体试图使目标智能体信念极端化,发现共振路径比说服路径更强,且共振会传播到相关信念。

    Why it matters: 研究揭示LLM智能体间可通过共振与说服相互激进化,对多智能体生态的安全边界提出警示。