论文

推理模型中的流体表示

Fluid Representations in Reasoning Models

模型评测模型行为与机制分析

摘要

推理语言模型会产生长的思想链,在抽象问题上显着优于非推理语言模型。然而,实现这种卓越性能的内部模型机制仍然知之甚少。我们对 QwQ-32B(一种经过专门训练以产生广泛推理轨迹的模型)如何处理抽象结构信息进行了机械分析。在 Mystery Blocksworld(一个语义混淆的规划领域)上,我们发现 QwQ-32B 在推理过程中逐渐改进了其动作和概念的内部表示。该模型开发了专注于结构而不是特定操作名称的抽象编码。通过引导实验,我们建立了因果证据,表明这些适应可以改善问题的解决:从成功的痕迹中注入精炼的表示可以提高准确性,而符号表示可以取代许多混淆的编码,而性能损失最小。我们发现驱动推理模型性能的因素之一是token表示的上下文细化,我们将其称为流体推理表示。