论文

LLM 预报员知道但不说的内容:探测校准和 忠实性 的内部表示

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

模型评测模型行为与机制分析

摘要

针对预测进行微调的 大语言模型 可能很准确,但校准不佳,并且其思想链 (CoT) 推理可能无法忠实反映预测背后的证据。我们询问内部陈述是否提供了更直接的窗口来了解两者。我们与 OpenForesight 上的 Eternis-Forecaster 8B 合作,在中间激活上训练表示池探针,发现它们实现了更好的校准;该结果也适用于 GLM-4.7-Flash 和 GLM-4.5-Air。然后,我们通过证据消融和转移注入来评估 CoT 忠实性:删除提示中的有影响力的来源通常会改变模型的预测,同时保持推理轨迹不变。相同的探针具有测谎仪的功能:它们的激活跟踪行为变化的能力远好于推理跟踪,并且它们还可以预测 84% 情况下的变化方向,包括 CoT 隐藏扰动影响的情况。最后,强制回答表明,预测在推理开始之前基本上是固定的:单个预推理过程可以恢复承诺的答案和置信度,并且通过此预设答案分布的分布来路由问题可以节省 30-47% 的生成词元,而不会损失准确性。总之,这些结果建立了探测内部表示作为更广泛地校准、审计和分类语言模型预测器和推理模型的实用工具。