论文
追踪语言模型“推理”中的不确定性
Tracing Uncertainty in Language Model "Reasoning"
摘要
语言模型 (LM)“推理”通常被描述为思想链或测试时间缩放,通常可以提高基准测试性能,但对该过程背后的动态仍然知之甚少。我们通过不确定性量化的视角来研究这些动态,将“推理”痕迹(LM 生成的中间标记序列)视为不断演化的模型状态。我们通过不确定性迹线轮廓来总结每条迹线:描述迹线上不确定性信号形状的一小组特征,例如其斜率和线性度。我们发现,在 GSM8K 和 ProntoQA 上评估的五个 LM 中,这些配置文件预测轨迹是否会产生正确的最终答案,AUROC 高达 0.807,比最近的相关工作有了显着改善。我们仅使用完整轨迹的前几百个标记就达到了 AUROC 0.801,这表明可以在生成的早期检测到错误。正确和错误迹线的详细比较进一步揭示了定性上不同的不确定性概况,正确的迹线显示出不确定性的更陡峭和不太线性的下降。总之,结果表明,我们的方法以不确定性下的决策为基础,为研究 LM“推理”的生成过程提供了一个原则性的视角。