论文
易读性不是可解释性:比较思维链推理中的判断重要性和实际重要性
Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning
摘要
思维链模型的推理痕迹似乎为模型如何得出答案提供了一个清晰的窗口。越来越多的工作也这样对待它们,使用 LLM 判断器来诊断错误,评估 忠实性,并通过过程奖励模型和生成批评家提供步骤级监督。这些实践依赖于推理步骤的文本,其中包含有关其功能角色的信息。但文本实际上编码了有关哪些推理步骤重要的信息吗?我们将推理步骤的重要性作为其优势:预期奖励的变化,例如,通过蒙特卡罗轨迹采样估计,从包含该步骤中产生正确的最终答案。基于 真值 这些估计,我们评估 LLM 法官是否能够识别高优势步骤,并发现足够有能力的 LLM 可以超越流行基线,但远远低于噪音上限。 微调 作为步骤级批评家的模型对错误响应产生了很大的改进,但距离正确响应的上限仍然很远,这表明步骤重要性只能从推理跟踪的文本中部分恢复。我们的发现有助于越来越多的思想链 忠实性 工作,该工作警告不要将推理痕迹的易读性视为可解释性,尤其是对过程奖励建模的影响。