arXiv · Machine Learning Theory· Jiacheng Qiu, Christopher E. Mower, Jan Peters, Haitham Bou-Ammar, Matthieu Zimmer·· 7 hr agoSelectedAI score62
扩散语言模型智能体的动作是否仍能解释任务:反向评分方法
Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model Agents
AI brief
论文指出扩散大语言模型(dLLM)并行解码虽降低延迟,但智能体在具身任务中会陷入重试循环,原因在于掩码解码的自适应性使失败动作被上下文自信填充而未接触失败信号。作者将此建模为任务无关的上下文污染,并证明该污染因子在反条件概率中精确抵消;据此提出 Reflect Reverse 方法,通过掩码任务 token 并去噪来评估反向前向条件。实验在四个多轮具身基准上提升了任务成功率与进展率。
Why it matters
论文揭示了 dLLM 智能体重试循环的机制成因,并提供无需训练的反向前向评分修正方法。
Source: arXiv · Machine Learning Theory · arxiv.org