论文

预训练模型评估中缺失的部分:奖励引导解码无需参数更新即可解锁面向任务的行为

The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

模型推理解码与生成控制

摘要

随着大语言模型(LLM)的快速进展,可靠地评估预训练的LLM的能力变得越来越重要。挑战在于,基础预训练模型针对下一个标记预测进行了优化,并且通常无法遵循指令或在标准提示和直接解码下产生格式良好的答案。因此,基准性能可能会将模型能力与解码引起的失败混为一谈,以产生面向任务的输出,而暴露此类行为通常依赖于昂贵的 后训练。最近的仅解码方法试图重塑输出分布,但这种方法在开放式任务中可能效率低下且脆弱。为了解决这些限制,我们提出了基于能量的解码(EBD),这是一种 无需训练 奖励引导框架,用于在开放式和客观任务中从冻结的预训练 LLM 中激活面向任务的行为。 EBD 使用外部轻量级奖励模型增强解码,引导一代人做出高效用响应,同时通过奖励倾斜的目标分布将它们锚定到预先训练的模型。我们表明,EBD 将基本模型输出转向更多的指令遵循行为,增加了与训练后对应模型的行为相似性,并能够对可访问的预训练模型行为进行更公平的推理时间评估。根据经验,EBD 在五个模型和六个基准测试中的表现优于基线,将 AlpacaEval2.0 上的 Qwen3-8B-Base 从 8.8 提高到 44.5,相对于之前的解码工作将 Mistral-7B Math500 延迟减少了 18.9 倍,并且对奖励模型大小保持稳健。