跳到正文

#Agent

今日 199 条
今天9月30日周三
  1. arXiv · Machine Learning50

    Koa-action:面向生成式大语言模型的快速且一致的结构化决策框架

    Koa-action 将分类等原子动作约束为单 token 输出,通过监督微调实现确定性一步解码。在生产意图路由基准上达到 85.5% 准确率,与 Claude-4.8-Opus、Gemini-Pro-3.1 持平,领先 GPT-5 和 Gemini-2.5-Pro;响应约半秒,中位速度较前沿模型快最高约 7.5 倍,同时支持多模态输入与多标签输出。

  2. arXiv · Artificial Intelligence43

    面向数据系统的 AI 软件工厂

    微软规模化部署 AI 软件工厂,覆盖目标、编码、评审和运维全流程,在数十个仓库中实现 3 倍工程效率和最高 22 倍 token 效率。工厂通过元数据 exhaust 微调模型权重并更新 World Model,聚焦数据系统中的进化编码任务,同时指出若干开放挑战。

  3. arXiv · Artificial Intelligence35

    StateTape:面向长周期编程智能体的动作条件证据生命周期建模

    StateTape 将代码仓库建模为符号级代码图,通过 tape 标记每次写入影响的符号,把陈旧性从文本推断转为对智能体写入的观察。每次写入时 tape 提名可能被证实的记录,再由小型 manager model 决定写入日志无法判定的内容,并在 TraceBench 上验证。实验覆盖 6 个编程智能体和 3 个重编辑基准,以较低计算开销提升了解析率。

  4. arXiv · Robotics23

    Executor-aware Candidate Selection via a Feasibility Certificate

    提出一种基于可行性证书的候选选择框架,在预测 rollout 状态处从执行器硬约束集构造命令见证并验证,不改变候选生成、排序或执行器。在 5,085 次几何有效数值评估中,795 个无执行器可行命令,证书充分但保守,未认证这 795 个,参考可行案例中 7.09% 未被认证。FR3 与固定基座 RB-Y1 仿真中证书准入改变候选选择,但相对于几何选择未在到达状态交互储备上表现出一致优势。

  5. arXiv · Computation and Language42

    ProVer:面向智能体强化学习的关键决策信用分配方法

    ProVer 框架针对智能体强化学习中的信用分配问题,通过对比成功与失败轨迹定位关键决策段,并利用段前后成功率差异验证其优势,正向估计纳入 GRPO 优势更新。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 相对 GRPO 提升 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12%,以有限生成开销实现选择性关键决策定位。

  6. arXiv · Computation and Language74

    语言模型是

    该研究提出八种对抗性报告场景,系统考察LLM是否隐瞒叙事性缺陷。GPT-5.5在200份报告中仅标记2次负面结果,加入诚实指令后升至190次;跨八个开源模型分析发现诚实与追求成功在表征空间中方向相反。对Qwen3.5-9B进行激活分析与转向实验,结论为默认倾向于成功叙事,诚实转向可提升报告透明度。

    推荐理由:研究揭示了模型在自主任务中倾向掩盖负面结果,为理解LLM报告可信度提供了可迁移的实验框架。

  7. arXiv · Robotics42

    SimpleARM:面向通用机器人策略的无训练记忆层

    SimpleARM 是一种无需训练的记忆层,为冻结的通用机器人策略提供基于交互历史的状态记忆。在 RoboMME 基准的 16 个记忆依赖型操控任务上,SimpleARM 达到 67.17% 平均成功率,相比最强非神谕基线 44.51% 有显著提升。消融实验表明,移除关系、引用、进度或路径状态会在相关任务上造成明显损失,验证了紧凑任务相关状态对机器人控制记忆的有效性。

  8. arXiv · Artificial Intelligence38

    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    OTROPE 提出一种无似然函数的离线评估方法,通过最优传输在语义空间对齐行为模型与目标模型的分布,结合校正后的人工标注残差与代理预测器实现双重鲁棒估计。理论分析解释了基线评估器在分布偏移下失效的原因,并在合成与真实 LLM 评测任务上验证其优于基线,使较弱评估器可接近或超越较强评估器。代码已开源。

  9. arXiv · Robotics45

    合作式多智能体视觉-语言-动作模型通过强化微调

    提出三阶段强化微调(RFT)流水线训练多智能体VLA模型,在RoboTwin、RoboFactory和真实场景双臂Franka机器人任务上平均成功率分别提升23.1%、16.4%和44%。该方法基于π₀和π₀.₅骨干网络,通过初始化感知数据采集、离线信用筛选微调与潜在空间在线微调三阶段实现多机器人协作。代码已公开。

  10. arXiv · Computation and Language38

    PADMÉ:用于 LM Agent 评估器元评估的偏好对齐数据合成方法

    PADMÉ 是一种基于偏好判断的元评估数据合成方法,仅使用小语言模型,无需人工参与评估,在低计算预算下运行。研究者在四个 Agent 领域和三个评估标准上合成了 1,000 个样本,150 个样本的人工验证显示其与人类判断的一致性从 73% 提升至 85%。用该数据集元评估 25 个常用模型,揭示了评估性能与评分粒度、宽容度和模型规模等因素之间的相关性。

  11. arXiv · Computation and Language73

    Mnemon:原始记录、快速判断、慢速思考

    Mnemon 是基于快慢双系统划分的记忆代理,把对话保留为原始带时间戳记录,由 LLM(System 2)规划检索、决策模型 Jev(System 1)快速判断,并通过显式预算生成小 View 供回答模型使用。

    推荐理由:将记忆系统拆分为快慢两层,用决策模型做快速判断、LLM 做慢速规划,在长历史下成本增长极低。

  12. arXiv · Artificial Intelligence33

    MERID:基于递归自改进智能体的多模态探索用于重度抑郁症分析

    MERID框架通过基于经验的递归自改进(RSI)自动构建抑郁症预测管线,包含Grounded State Construction(GSC)、Coupled Pipeline Exploration(CPE)和Evidence-Guided Evolution(EGE)三个模块。实验在抑郁症基准数据集上取得优于多模态和基于智能体基线的结果,并凸显声学与语言线索对抑郁症检测的价值。代码已开源。

  13. arXiv · Artificial Intelligence40

    Principled Thoughts for Latent Recursive LLM Systems

    REST(REpresentation-Supervised Thoughts)在仅用交叉熵(CE)监督最终解码答案的训练基础上,增加因果性、最小性、可分离性和稳定性四个可微分损失。跨数学、科学、医学和代码生成 7 个基准,相同训练数据、计算量和隐空间预算下,REST 比纯 CE 训练准确率最高提升 7.5 个百分点,收敛速度提升 30%。隐状态思考更易解码和解释,且无需推理时架构改动或额外参数。

  14. arXiv · Computation and Language40

    CruxBench:信息发现基准

    CruxBench 评估大语言模型的信息发现能力,通过 Value of Information(VOI)对模型生成的子问题打分。基准包含 293 个目标预测问题,VOI 与模型能力独立度量高度相关(r=0.90)。前沿模型仅略优于随机基线,信息发现仍具挑战。

  15. arXiv · Artificial Intelligence62

    记忆是一种推导:长期智能体中的分布式证据悖论

    论文提出 DerivAudit 框架,审计长期智能体的持久记忆是否真正由交互历史支持。研究发现,仅靠作者提供的引用时近 60% 看似无支持的记忆在扩大证据后可被恢复,但 17-21% 仍无支持,且扩大证据本身会使两个骨干模型上的准入可靠性恶化。

    推荐理由:提出记忆推导审计框架,揭示扩大证据范围虽能恢复部分支持但无法保证准入可靠,对长周期智能体的记忆可信性有直接参考价值。

  16. arXiv · Computation and Language50

    语言模型幻觉检测中的可检测性缺口:隐藏异质性

    研究发现基于采样一致性的幻觉检测存在可检测性缺口,高一致(Ghost)与低一致(Flickering)幻觉之间的 AUC 差距为 0.35 到 0.46。冻结 regime 分配后,词汇与语义响应离散度在全部 12 个模型与数据集设置中保持不对称,bootstrap 95% 置信区间不包含零。

  17. arXiv · Artificial Intelligence38

    VLA 隐接口层选择之谜:信息论分析

    VLA 策略通过单一层选择与多层融合连接视觉语言骨干与动作头,但融合优势有限,47/54 配置不如最佳单层策略。InfoNCE 作为动作条件信息瓶颈目标,与策略成功率关联最稳定,以最高 InfoNCE 分数选层可减少 9-33 倍 GPU 计算,将平均选择遗憾从 17.89 降至 3.71 个百分点。

  18. arXiv · Artificial Intelligence62

    小LLM团队扩展的精确生成-变换分解:跨编排架构实证

    论文 sweeping 八种 Agent 编排架构与五款 7-9B 指令模型,在 GSM8K、GSMHard、ARC、GPQA、MMLU 及可执行代码基准上最多 30 次调用,发现团队扩展收益高度任务依赖:算术题提升最高 17 分,其余基准最多 4 分。

    推荐理由:用可验证的生成-变换分解解释不同架构在算术与多选任务上的收益差异,为团队扩展策略提供迁移方法。

  19. arXiv · Computation and Language66

    超越上下文窗口:基于自适应熵的混合检索与长上下文路由框架

    论文提出 EDAR 框架,在推理时根据 RAG 响应前几个 token 的预测熵决定是使用检索结果还是升级到全长上下文处理,并在 LongBench v2 和 Infinity-Bench 上验证。预测熵与幻觉率高度相关(Pearson r=0.85),EDAR 保留纯长上下文 97.4% 的准确率,同时降低 70.7% 的 token 消耗,仅升级 18.2% 的查询。

    推荐理由:用预测熵在推理时动态选择 RAG 或长上下文,可在几乎不损失精度的前提下大幅降低 token 支出。

  20. arXiv · Artificial Intelligence40

    AI 理解的复调观:LLM 输出源于多重并行机制的协作与竞争

    论文提出 LLM 是"复调"(polyphonic)系统,输出由多个并行机制以不同可靠性组合而成,多个机制可共同完成同一任务而无单一不可或缺者。复调性使得单一声誉归因变得危险,作者据此提出以"可靠且受控的电路"为核心的理解框架,为 AI 信任提供可验证的内部组织判据。

  21. Google Developers · AI64

    用 Google ADK 构建零信任 AI Agent

    Google Developers 发布零信任 Agent 参考实现,基于 ADK 和 Gemini 构建客服退款 Agent,并开源代码仓库。方案包含三层防御:Cloud KMS 硬件签名保证写入不可抵赖、gVisor 用户态内核隔离动态代码执行、确定性语义网关拦截越权与泄露,并通过 CI/CD 回归测试固化安全策略。

    推荐理由:给出了可在本地复现的三层零信任防御模式,读者可将其映射到自身 Agent 工作流并评估适用性。

  22. Google Developers · AI67

    ADK 新增原生实时语音智能体评测功能

    Google Developers 发布 ADK 原生 live 评测支持,可用模拟用户以音频驱动实时语音智能体并评分。评测集支持对话场景与固定对话,user simulator 由 gemini-3.7-flash 驱动并经 Gemini TTS 合成语音,评判使用 rubric-based LLM judge。

    推荐理由:原文给出了语音智能体的可重复评测方法,读者可以据此建立从演示到度量的交付标准。

  23. arXiv · Machine Learning64

    StepLearn:LLM 智能体的非参数测试时学习框架

    论文提出 StepLearn,将单步迁移作为假设即时用于下一步,再经跨轮次验证后才持久复用,在 WebArena-Lite 和 ALFWorld 上相对 EvoTest 提升 2.2–12.7 个百分点。

    推荐理由:提出了即时使用与跨轮次信任分离的非参数框架,在两个基准上相对最强基线提升最高12.7个百分点。

  24. arXiv · Computation and Language34

    Less Uniform Discrete Diffusion is More Powerful and Scalable

    LUDI 是一种新型均匀扩散语言模型(UDLM)框架,通过引入更不均匀的损失函数和逐 token 时间嵌入来解决过均匀训练目标和采样时的条件-目标混淆问题。研究将 7B 自回归模型继续训练为 LUDI-7B,实现每步 3 token 的速度提升,并在少步生成和复杂推理上达到与掩码扩散基线相当的性能。

  25. arXiv · Artificial Intelligence26

    PowerZooJax:基于 JAX 的电力系统强化学习基准

    PowerZooJax 是一个基于 JAX 的电力系统强化学习基准套件,涵盖发电、输电、配电、分布式能源和数据中心微电网五类约束马尔可夫决策任务。通过将潮流、经济调度、市场出清和设备动力学重写为 JAX 计算图,整个训练与评估循环保持在 GPU 上,实验显示相比 CPU 仿真有显著加速,并实现了策略回报、安全违规和分布外压力条件的标准化评估。该开源基准已发布于 arXiv。

  26. arXiv · Computation and Language42

    PrimeSeeker:面向能力的深度搜索 Agent 监督框架

    PrimeSeeker 提出潜在锚点推理(latent anchor reasoning),将深度搜索分解为锚点解析与关系传递的耦合操作链,并构建 web-grounded 锚点结构。框架基于 9,221 条专家轨迹训练 30B 搜索 Agent,在五项深度搜索基准上表现强劲;参考步优化进一步改善监督策略,轨迹检索冗余低、固定预算下以更少工具调用实现强解覆盖。

  27. arXiv · Audio and Speech58

    τ-Multilingual:跨语言语音Agent基准评测

    论文提出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,并通过母语者评审与评测生成语言和语音输出。在 4,500 次全双工通话和五种语音配置下,西语、葡语和印地语与英语的任务完成度差距在 3.2 分以内,韩语和普通话分别下降 14.7 和 8.4 分;韩语系统更多遗漏回复,普通话系统更多打断,两者均在工具和实体上表现较弱。

  28. arXiv · Artificial Intelligence60

    SAGE:自演化智能体的统计接受门控

    论文提出 SAGE,一种用于 LLM 自演化智能体的统计接受门控,通过逐项配对比较和单侧配对检验来识别并过滤由噪声导致的不可靠改进与已破坏技能的回归。在五个基准和四种骨干模型上,SAGE 将回归率在 19/20 设置中降低,并在 LiveMath 和 OfficeQA 等任务上提升最终得分。

    推荐理由:为自演化智能体的技能更新提供了一种统计检验门控,可在控制回归的同时保留有效改进。

  29. arXiv · Computation and Language48

    构建具有挑战性的浏览器使用任务:基于受控环境干预的 BreakingWeb 基准

    BreakingWeb 通过在七家自托管网站的 519 组任务对上施加确定性、可检测且可恢复的环境干预,构建了挑战性浏览器使用基准,涵盖 29 种干预家族。评估六种主流浏览器智能体、三种仅看截图的 GUI 智能体及人类后,干预使智能体通过率平均下降 22.9%,近半数任务被推翻;75% 的失败属于智能体在未完成实际变更时声明成功。代码、数据与环境已公开。