论文

推理还是流畅?剖析Best-of-N选择中的概率置信度

Reasoning or Fluency? Dissecting Probabilistic Confidence in Best-of-N Selection

模型推理推理验证与自校正

摘要

概率置信度指标正日益被用作 Best-of-N 选择中推理质量的代理,其假设是更高置信度反映更高的推理保真度。在本工作中,我们质疑这一假设,研究这些指标是否真正捕捉有效推理所必需的步间因果依赖。我们引入三类步间因果扰动,在保持局部流畅的同时系统性地破坏推理步骤之间的依赖。令人意外的是,跨多样模型家族与推理基准,我们发现这些扰动下选择准确率仅轻微下降。即便是施加硬注意力掩码、直接阻止模型关注先前推理步骤这样的严重干预,也不会大幅降低选择性能。这些发现有力证明当前概率指标对逻辑结构基本不敏感,而主要捕捉表面流畅或分布内先验。受这一差距启发,我们提出对比因果指标,显式隔离步间因果依赖,并证明它比现有基于概率的方法产出更忠实的输出选择。

推理还是流畅?剖析Best-of-N选择中的概率置信度
图2:所提出的因果性扰动的整体示意。从左到右,各图描绘:(i) 未改变的评估过程,其中完整的推理轨迹以自回归方式被评估,以计算概率化置信度指标;(ii) 注意力层面的扰动,其中跨步注意力被掩蔽,每个推理步骤被独立评估;(iii) 参数层面的扰动,其中使用一个更小的评估器模型;(iv) 数据层面的扰动,其中推理轨迹在评估前被修改(如顺序打乱)。