论文

Rotate2Think:通过正交旋转进行几何启动以改进语言模型推理

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

模型推理推理策略与问题分解

摘要

推理模型通过在产生最终答案之前生成显式的中间推理轨迹,在具有挑战性的任务上实现强大的性能。然而,推理时表示空间的内部结构仍然知之甚少:模型的隐藏表示在思考过程中与输入提示的嵌入有何不同,以及是否可以利用这种结构在推理时引发更强的推理?我们表明,输入嵌入和思维嵌入(分别在提示和推理轨迹上的平均池化最后层隐藏状态)都表现出极高的锥度,所有向量都紧密地聚集在单个平均方向周围。至关重要的是,这些平均输入和思维方向是非共线的,思维嵌入在许多不同的模型和基准任务中占据嵌入空间的几何上不同的区域。这一观察结果促使将输入到思维的转变视为一个旋转问题,通过正交普罗克拉斯特斯分析承认封闭式解决方案。我们提出了 Rotate2Think,一种 无需训练 方法,该方法从一小组正确解决的示例中估计这种旋转,并在推理时将所得的综合思维向量注入思维定界符之间,从而在推理轨迹开始时提供几何引物。 Rotate2Think 通过多个基准和模型系列进行评估,提高了数学、科学和代码任务中 32 个模型基准配置中的 30 个的准确性,并将 MATH-Vision 上的零样本推理推广到多模态推理。