论文
置信几何揭示了 大语言模型 推理中的痕量级正确性
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
摘要
大语言模型 (LLM) 不仅生成推理文本,还生成 词元级 置信轨迹,记录推理过程中不确定性如何演变。这些轨迹是否与推理正确性相关仍不清楚。在这里,我们展示了置信轨迹编码与跟踪级别最终答案正确性相关的与内容无关的置信几何。仅使用 词元级 置信值,而不访问输入问题、推理文本、隐藏状态或外部验证器,我们发现置信轨迹的低维表示将正确与不正确的推理轨迹分开。在 GSM8K、MATH 和 MMLU 中,这种几何分离与下游可预测性定量相关:通过 Davies-Bouldin 指数测量的正确和错误迹线的更强聚类,始终对应于更高的正确性辨别 AUC。我们进一步表明,与正确性相关的信息在推理的尾部得到了丰富,这表明后期信心动态携带着关键的正确性信号。我们提出了 NeuralConf,一种轻量级估计器,可以从置信轨迹中学习以进行正确性评估。在固定的跟踪预算下,NeuralConf 派生的分数改进了多数投票、尾部置信度和其他静态基线的置信加权答案聚合。这些结果表明,LLM 通过其自身的置信度动态公开正确性的跟踪固有统计信号,从而提供了一种使用生成中已存在的信息来改进推理的途径。