论文
推理模型知道什么是重要的,并将其编码到其激活中
Reasoning Models Know What's Important, and Encode It in Their Activations
摘要
语言模型通常通过生成长推理链来解决复杂的任务,推理链由许多具有不同重要性的步骤组成。虽然有些步骤对于生成最终答案至关重要,但其他步骤是可以删除的。确定哪些步骤最重要以及为什么最重要,仍然是理解模型如何处理推理的核心问题。我们研究这个问题是否最好通过模型内部或推理链本身的标记来解决。我们发现模型激活包含比标记更多的信息来识别重要的推理步骤。至关重要的是,通过训练模型激活探针来预测重要性,我们表明模型甚至在生成后续步骤之前就编码了步骤重要性的内部表示。不同模型中重要性的内部表示对于哪些步骤是重要的具有高度一致性。该表示分布在各个层中,并且与表面级特征(例如步骤的相对位置或其长度)无关。我们的研究结果表明,分析激活可以揭示表面层方法从根本上忽略的推理方面,这表明推理分析应该研究模型的内部结构。