论文

高概率答案何时正确?LLM序列概率与正确性的关系

When are likely answers right? On Sequence Probability and Correctness in LLMs

模型评测模型行为与机制分析

摘要

大语言模型 的许多解码方法可以理解为将概率质量转移到模型下更有可能的输出,无论是在 词元级 本地还是在序列级别全局。因此,他们的成功取决于一个基本问题:序列概率,即给定提示的连续的条件概率,何时真正与正确性一致?在本文中,我们着手在四个级别上量化解码方法、模型和基准之间的这种关系:跨解码方法、跨方法内的超参数、跨数据集中的提示-答案对以及跨对同一提示的重复响应。我们发现较高的序列概率通常可以预测固定数据集中提示-答案对的正确性。然而,这种关系通常不会转移到解码决策:通过改变超参数或方法来增加序列概率并不能可靠地提高准确性。此外,序列概率并不是对同一提示的响应正确性的良好指标。这些发现阐明了解码何时可以或不能提高正确性,并为解码、自我一致性和无验证者自我改进提供实用指导。