论文
确定性不仅仅是正确性:重新思考 LLM 推理中的词元级确定性
Certainty Is Not Just Correctness: Rethinking Token-Level Certainty in LLM Reasoning
摘要
词元级别的确定性被广泛用作 LLM 训练和推理中正确性的代理。然而,基于确定性的方法的性能取决于确定性分数中的信息以及这些分数的使用方式。因此,我们通过跨模型和任务的受控实证评估来直接评估确定性的预测能力。我们区分两个预测目标:识别模型更有可能正确回答的问题,以及区分对同一问题的正确回答和错误回答。在我们的实验中,确定性通常更适合识别模型可能正确回答的问题,而不是区分对同一问题的正确回答和错误回答。确定性也会因标记类型和单词中的位置而系统地变化,反映了单词和文本形式的局部属性。有关问题难度的信息出现在生成的早期,而有关答案正确性的较弱信息则在接近结束时更加集中。这些发现表明,为决策提供的信息确定性取决于预测目标、模型、确定性度量以及响应中的哪些标记位置包含在聚合中。我们进一步证明了这些发现对于测试时计算的实用价值。我们在生成早期使用确定性来分配响应数量,并在每个响应接近结束时使用确定性对答案投票进行加权。与固定采样多数投票基线相比,这种方法将整体准确率从 78.71\% 提高到 79.54\%,同时将生成词元成本降低了 82.4\%。