论文
测试时深度思考以探索隐式规则
Test-Time Deep Thinking to Explore Implicit Rules
摘要
随着大语言模型(LLM)的不断进步,智能体正变得日益重要。然而这些智能体常在由隐式规则支配的环境中失败——隐式规则是无法直接观察、必须通过交互推断的隐藏约束。这使智能体陷入重复的试错循环,最终导致任务失败。为应对这一挑战,我们提出测试时探索(Test-Time Exploration,TTExplore),一个由思考组件分析交互历史以推断隐式规则并指导行动者的框架。在此设定下,有效探索关键取决于思考组件的推理能力。然而评估深度推理轨迹本质上不稳定且困难,这构成有效训练的主要障碍。为克服这一问题,我们提出一个新颖且稳定的强化学习流水线。核心思想是用精确的任务级分数作为间接奖励来绕开评估中间推理的困难,并且每条轨迹只保留单个思考节点以缓解奖励稀疏。利用该流水线,我们训练了一个专门的7B模型Exp-Thinker。在五个文本具身任务上的实验表明,配备Exp-Thinker的TTExplore将基线智能体性能平均提升14-19分,证明了对隐式规则进行显式推理的有效性。
