论文

推测性细化:混合自回归扩散解码策略及其跨基准的行为

Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks

模型推理解码与生成控制

摘要

我们应该如何评估结合自回归(AR)和扩散解码的生成系统?我们通过 Speculative Refinement (SpecRef) 研究这个问题,这是一种 无需训练 混合方法,使用熵引导的选择性掩蔽从 AR 草稿中热启动掩蔽扩散语言模型。通过使用三种不同的评估协议(基于执行的 pass@1、精确匹配、对数似然评分)对六个基准(HumanEval、MBPP、GSM8K、BBH、ARC-Challenge、HellaSwag)评估 SpecRef,我们得出了与我们的特定系统相关的几个发现:(1)代码基准将结构发现与逻辑正确性混为一谈:提供语法支架将准确性从接近零提升到超过 20%,而无需更改模型,这表明基线失败大部分是结构性的; (2)细化紧张现象,多阶段修正降低了已经正确的标记,暴露了单模型评估看不见的基准饱和度上限; (3)对数似然和生成评估对同一模型对产生不同的模型排名,表明它们衡量的是不同的能力; (4) 标准 Python 后处理默默地破坏了非 AR 生成器的代码评估。这些观察结果适用于任何多阶段或非自回归生成管道,并指向更多的诊断评估实践。