论文
更正确的质量,更糟糕的答案:为什么功率采样会失败以及如何修复它
More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It
摘要
功率采样锐化了语言模型在完整生成轨迹上的分布,提供了一种无需验证者的方式来改进推理时的推理。它还具有作为各种下游采样方法的通用前端的潜力。然而,我们发现了一个惊人的悖论:功率采样可以将更多的概率质量推向正确的轨迹,同时降低其旨在增强的下游推理能力。使用自我一致性作为代表性案例,我们观察到模型和推理基准的准确性下降了高达 18.5 个百分点。我们将这个悖论追溯到两个不匹配的地方。剂量不匹配的出现是因为固定指数会导致问题之间的分布变化量截然不同。覆盖不匹配的出现是因为全局锐化将质量集中在一组狭窄的主导路径上:高通@k,通常被解释为保留多样性的证据,因此可以与下游聚合、搜索和选择所需的广泛推理路径支持的丧失共存。在这一诊断的指导下,我们用变形控制、保持支撑的功率目标取代了统一轨迹求幂,该目标可以校准问题的锐化,同时限制对中等概率路径的抑制。在具有加权自一致性的相同预算实例中,修复后的采样器逆转了全局 Power 造成的损失,并且在推理基准上优于标准多样本推理。