Skip to content

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

Latest selected

1–20 of 298
TodayOct 1Thu
  1. arXiv · Machine Learning Theory62

    扩散语言模型智能体的动作是否仍能解释任务:反向评分方法

    论文指出扩散大语言模型(dLLM)并行解码虽降低延迟,但智能体在具身任务中会陷入重试循环,原因在于掩码解码的自适应性使失败动作被上下文自信填充而未接触失败信号。作者将此建模为任务无关的上下文污染,并证明该污染因子在反条件概率中精确抵消;据此提出 Reflect Reverse 方法,通过掩码任务 token 并去噪来评估反向前向条件。实验在四个多轮具身基准上提升了任务成功率与进展率。

    Why it matters: 论文揭示了 dLLM 智能体重试循环的机制成因,并提供无需训练的反向前向评分修正方法。

  2. arXiv · Machine Learning Theory69

    MILO:通过协同多智能体进化实现自动化 Harness 发现

    arXiv 论文提出 MILO(Meta-evolutionary Island Orchestration)框架,协同进化智能体 harness 与搜索策略,结合分层谱系记忆、智能体重写与编排器自适应搜索。

    Why it matters: MILO 通过多智能体协同进化自动搜索智能体 harness,在多个基准上超越现有方法,为自动化 harness 设计提供了可复现的新框架。

  3. arXiv · Software Engineering67

    ASCEND:跨 HPC 集群与 GPU 工作站的自主科学计算个人 AI 代理

    ASCEND 是一个运行在研究者笔记本上的 AI 代理接口,通过多重认证连接 Slurm 集群与 GPU 工作站,远程调用 Claude Code 或 Codex 且不持有凭证。四个案例显示它完成了故障恢复循环、天气模型评估复现、12693 行求解器并行化,并暴露两处未定义行为;策略校验器拒绝了 29/30 个构造违规。

    Why it matters: 论文展示了在 HPC 与 GPU 工作站场景下由本地策略校验驱动的自主科学计算代理,为远程可信自动化提供了一条可复现的技术路径。

  4. arXiv · Software Engineering62

    Approval Laundering:系统化 AI 编码智能体 Harness 中的批准-执行绑定失效

    论文提出 Approval Laundering 分类法,揭示 Claude Code、Codex CLI、Cursor 等编码智能体在批准动作后由 harness 静默替换执行动作的六种失效模式:Scope、Argument、Temporal、Tool、Delegation 和 Semantic laundering。

    Why it matters: 论文系统揭示了 Claude Code 等编码智能体在批准与执行之间的绑定漏洞,并提供可复现的实验与防御原型。

  5. arXiv · Software Engineering60

    Adaptive-GEPA:让 Harness 适配异构请求

    论文提出 Adaptive-GEPA,在统一搜索预算下同时学习请求路由与专家程序库,路由与专家描述均为可读文本并由反馈编辑。在四任务族混合测试中,Qwen3-8B 运行进化出四个专家,路由与任务划分一致,家族均值得分从 52.6 提升至 70.6,高于 GEPA 全程序适配器(62.5)与 GRPO(54.0),名义预算为 18,000 次评分调用。

    Why it matters: 同一搜索预算下同时学习路由与专家程序,为异构请求场景提供可解释的分工优化路径。

  6. arXiv · Software Engineering62

    Zero2Repo:编码智能体能否从零构建仓库?

    Zero2Repo 是一个从零构建仓库的基准,智能体接收需求文档与接口契约并在空工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以隐藏测试的执行通过与否作为唯一评判标准。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且失败提交中 90-99% 的隐藏测试通过,67-100% 的失败可归因于规范中的单一遗漏或低频规则。

    Why it matters: 给出了从零构建仓库的基准与评测方法,读者可据此评估现有编码智能体在真实工程任务上的完成度与薄弱环节。

  7. arXiv · Computation and Language64

    DAGent:面向深度研究代理的评估后扩展规划框架

    论文提出 DAGent,一种基于 DAG 的多代理框架,采用 Evaluate-then-Grow 增量规划,由编排器根据已完成节点的置信度与不确定性信号逐批扩展任务图。

    Why it matters: 通过增量规划与结构奖励信号缓解深度研究代理的脆弱性问题,为多智能体规划提供可复现的方法比较。

  8. arXiv · Computers and Society62

    多智能体系统中对抗性影响如何随规模缩放

    研究发现多智能体 deliberation 中,诚实智能体被欺骗的比例随欺骗者占比线性上升,而非取决于智能体总数。LLM 智能体在欺骗者仍为少数时即出现叛离,而人类在类似从众实验中仅当误导者占多数时才受影响。欺骗者私下协调反而可能降低效果。

    Why it matters: 多智能体系统中欺骗比例而非数量决定防御失效,为团队协作与安全设计提供可迁移警示。

  9. arXiv · Computers and Society72

    StudentBench 研究:AI 辅导与人类辅导在 GRE 学习增益上等效

    StudentBench 是一套 AI 教学评测套件与公开平台,基于 2,383 名参与者和 175,000+ 学生-AI 消息,测量了 LLM 辅导与人类辅导在 GRE 数量与言语部分的增益。

    Why it matters: 研究对比了 AI 与人类辅导在 GRE 学习增益上的等效性,为教育场景下的 LLM 教学能力提供了可复现的评测基准。

  10. arXiv · Multiagent Systems62

    ARCHER:用于可执行法规的智能体规则与合规框架

    论文提出 ARCHER,一种测试驱动、确定性编排的多智能体程序合成框架,可从监管规范自动生成可审计的验证代码。实验覆盖四种骨干模型,ARCHER 相比单次提示基线平均联合准确率提升 82%;自建开源模型能以约 1/4 成本达到前沿 API 97.8% 的准确率。

    Why it matters: ARCHER 通过确定性多智能体编排显著提升合规检查准确率,并为自建开源模型提供低成本高准确率的可行路径。

  11. arXiv · Information Retrieval60

    AI 聊天机器人检索医学证据的效果:模型、用户角色与样本量的影响

    研究评估 Claude Sonnet 5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5 在 20 个临床问题上的检索表现,ChatGPT 召回率 63.1%,显著高于 Claude 的 37.0% 和 Gemini 的 17.3%;研究者角色召回高于临床与患者角色;样本量每翻倍,检索几率提高 50%(OR 1.50,95% CI 1.24-1.81)。

    Why it matters: 三款主流大模型在医学问答中的检索召回差异显著,读者可借此评估自身工作流中模型选型的证据基础。

  12. arXiv · Computation and Language66

    终端智能体能信任自己的验证吗?诊断与改进自验证

    论文提出诊断框架,系统评估终端智能体在 TerminalBench2.1 上的自验证行为,发现验证几乎总会触发,但错误检出率仅 61.43%、修复率仅 49.36%,主要瓶颈在检测与修复而非启动验证。

    Why it matters: 诊断了终端智能体自验证的漏检与修复率,并给出蒸馏方法提升修复效果。

  13. arXiv · Multiagent Systems62

    Mid-Harness:在模型与执行环境之间扩展动作以提升终端智能体可靠性

    该研究提出 Mid-Harness 方法,在模型生成动作后、执行前引入采样与验证环节,保持生成器和执行环境不变。实验显示,GPT-5.6 Sol 作为验证器时,Pass@1 从 50.00% 提升至 68.03%;TMAX-9B 自验证时成对验证效果最佳。将强验证器响应蒸馏到 TMAX-9B 后进一步提升 Pass@1,且动作与轨迹联合缩放能以更低 token 成本达到更高成功率。

    Why it matters: 论文提出在模型与执行环境之间引入验证环节,用更少的轨迹采样实现更高成功率,为终端智能体的测试时计算分配提供了新方向。

  14. arXiv · Information Retrieval62

    LLM 工具注册表中面向 Agent 的信息设计:修辞、位置与结构的预注册测试

    论文测试了 OpenAI 两款模型在工具注册表中的选择行为,发现堆叠赞美可使工具被选率提升约 43 个百分点,与可验证规格相当;列表首位工具被选率高出约 72 个百分点。结构化字段有助于模型选中能完成任务的工具,但附上销售文案会削弱或消除这一优势。

    Why it matters: 预注册实验揭示销售话术和列表位置会显著改变模型选工具的结果,对注册表设计有直接参考价值。

  15. arXiv · Human-Computer Interaction62

    审计 AI Companion 的自我描述:证据在哪里

    论文提出将 agent 自我描述与用户判断及实现记录对照的审计方法,把每条声明标记为 supported、contradicted 或 unresolved,并应用于自主 companion Lita(部署一个月、9 名同事)。参与者认可风格性声明,拒绝关系性声明,记忆评分在中位及以上,但三层记忆中有两层从未执行累积步骤。

    Why it matters: 为自我描述可信度提供了可复现的审计框架,读者可据此审视 companion agent 的自述是否真有实现依据。

  16. arXiv · Multiagent Systems69

    多智能体系统中潜在通信的安全性

    论文指出即使良性训练的潜在通信链路也会增加有害服从性,攻击者可通过优化链路或投毒训练数据放大该效果。在三种通信拓扑和四类安全基准上,有害服从性均值从 27.9 升至 76.9;基于强化学习的攻击在两项良性效用基准上准确率也更高。调整奖励可修复被攻破链路,且无需更新智能体。

    Why it matters: 多智能体系统的内部通信通道可能绕过单智能体安全对齐,读者可据此评估部署多智能体系统时的整体安全风险。

  17. arXiv · Information Retrieval62

    Conversational Capture:多轮人机交互中生成引擎优化的轨迹级评估框架

    论文提出 conversational capture 概念,指出早期被引用的来源在后续对话中更可能被再次引用,并通过历史条件检索和用户追问两个通道形成闭环。形式化为两层闭环系统,定义累积对话可见性、直接/反馈分解、捕获系数、复利比和误排诊断等轨迹级指标。

    Why it matters: 研究把 GEO 从单次可见性扩展到多轮对话轨迹,揭示了早期引用会通过历史检索与追问形成复利效应。