论文

推理摘要揭示了多少信息? 大语言模型 的可观测性阶梯

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

模型评测评测方法与指标

摘要

大语言模型 通常向用户显示最终响应和简短的推理摘要,而完整的推理跟踪保持隐藏。我们引入了一个可观察性阶梯,它使每次完成的运行保持固定,并且仅改变读者检查以判断答案是否正确的内容:响应、模型根据跟踪写入的自我摘要、跟踪本身以及内部信号,每个信号都有或没有提示。在三个基准测试和五个开放权重 Qwen3 和 gpt-oss 模型中,我们在每个访问级别上训练匹配的线性正确性预测器。如果没有提示,摘要将包含大部分跟踪的排名信号(平均 AUROC 0.774 与 0.813),并在单独的响应上添加 +0.156。当提示可见时,汇总增益下降至 +0.019,而迹线仍增加 +0.041。即使长度相同,痕迹的最后一句话也可以预测正确性和摘要,或者稍好一些,并且带有更密集和更具辨别力的不确定性和自我纠正线索。在正确和错误运行的 MMLU-Pro 问题上,线性摘要读取器几乎是偶然的,而迹线读取器仅保留适度的信号,无论是否有提示(提示保留的 AUROC 0.503-0.545 与 0.544-0.590)。在保留提示的情况下,GPT-5-mini 阅读器从 gpt-oss-20b 上的摘要和跟踪中恢复了更多的信号,即使如此,跟踪仍保持了+0.034 的小优势。线性读取器的大部分跟踪信号与长度相关。在用户已经按住提示的常见情况下,摘要对于监控正确性的帮助不如完整跟踪有用。因此,可监控性是显示器和阅读器的共同属性,因此任何可监控性声明(包括 忠实性)都应指定两者。