论文
这个动作还能解释任务吗?扩散语言模型智能体的反向评分
Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model Agents
摘要
基于扩散的大语言模型 (dLLM) 有望通过并行解码打破自回归Agent的顺序延迟瓶颈,但最近的评估表明,这种效率并没有转移到具体的 Agentic 能力:dLLM 支持的Agent反复陷入重试循环,在失败很久后重新发出操作。我们对这种故障进行了机械解释,并提供了无需训练的补救措施。我们将重试循环追溯到屏蔽解码的适应性:采样器提交它最有信心的位置并推迟不确定的位置,并且在失败状态下,上下文已经为推迟的决策(即失败的操作本身)提供了置信填充,因此在没有遇到失败反馈的情况下提交了重试。我们将由此产生的动作分布扭曲建模为任务盲腐败:上下文显着的动作(例如,刚刚采取的动作)通过依赖于状态和动作但不依赖于任务的因素而获得夸大的概率。在这个模型下,我们分析了一个不变性命题:任务盲因子完全从相反的条件中取消,即给定状态和候选动作的任务的可能性,这与理想化的未损坏模型的任务后验一致。与自回归模型不同,屏蔽 dLLM 通过屏蔽任务标记和去噪来本地评估反向条件,但代价是每个候选者需要进行几次并行传递。我们将该规则实例化为“反射反向”,并在四个多轮具体基准上对其进行评估,与前向评分基线相比,它提高了任务成功率和进展率。