论文
推理转变:上下文如何默默地缩短 LLM 推理
Reasoning Shift: How Context Silently Shortens LLM Reasoning
摘要
大语言模型 (LLM) 表现出测试时间扩展行为,例如扩展推理轨迹和自我验证,在复杂的长期推理任务中表现出了卓越的性能。然而,这些推理行为的稳健性仍未得到充分探索。为了研究这一点,我们对三种场景的多个推理模型进行了系统评估:(1)问题被冗长、不相关的上下文所增强; (2)具有独立任务的多轮对话设置; (3) 作为复杂任务中的子任务提出的问题。我们观察到一个有趣的现象:与单独提出问题时产生的轨迹相比,推理模型在不同上下文条件下对于同一问题往往会产生更短的推理轨迹(高达 74%)。更细粒度的分析表明,这种压缩与自我验证和不确定性管理行为(例如双重检查)的减少有关。重要的是,我们表明,即使强制进行额外的自检,其效率也不仅取决于推理痕迹的内容,还取决于冗余上下文的存在。我们希望我们的发现能够引起人们对 LLM 推理模型的稳健性和上下文管理问题的更多关注。