论文

国际象棋解释反映模型决策吗? LLM 推理忠诚度的行为和词元级别测试

Do Chess Explanations Reflect Model Decisions? Behavioral and Token-Level Tests of LLM Reasoning Faithfulness

模型评测模型行为与机制分析

摘要

大型语言模型可以对国际象棋的走法产生流畅的解释,但看似合理的语言并不一定反映决策背后的推理。我们在国际象棋中研究这个问题,棋盘状态是完全可观察的,法律行动可以列举,并且棋步质量可以独立评估。在 200 个 Lichess 残局谜题中,我们使用移动可恢复性、解码器端控制和合法候选移动的标记级评分来测试解释。公开的解释使得生成的走棋很容易恢复,但在明确的走棋提示被删除后,这种优势急剧下降。在严格的屏蔽下,解释仅提供相对于板状态而言较小且依赖于解码器的增益。标记级别的评分表明,解释仍然可以改变移动偏好:来自其他谜题的随机但合理的解释会降低正确移动的概率,这表明不相关的推理文本不会被简单地忽略。我们还发现,可识别的残局主题可以使生成的动作更容易恢复,而无需可靠地提高动作正确性。总之,这些结果表明语言的合理性、与生成的动作的一致性以及解决方案的正确性是不同的属性。流畅的国际象棋解释可以影响行动偏好并支持连贯的棋步叙述,同时仅提供有限的忠实推理证据。