论文
Second Thought:LLM智能体行动与观察时的并行推理
Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
摘要
ReAct范式下的LLM智能体在推理、行动与观察之间交替,但深思式推理被限定在Thought阶段:当智能体序列化一个动作并等待环境时,其推理被冻结。我们把Action与Observation之间这段反复出现的间隔识别为“推理空闲窗口”,并追问能否在其中并行承载服务于后续轮次的额外推理。为此,我们提出Second Thought,一个免训练的推理框架:在每个Thought阶段结束的瞬间分叉四个辅助分支,与主循环并发解码,并在环境观察到达时把生成的思考合并回来。这样,Second Thought把新增推理移出了主线程的顺序解码路径。在三个智能体基准与三个推理LLM上,Second Thought在全部九个(模型,基准)对中降低平均轮次数,并在其中六个中减少主线程解码最多43%(这些设置中平均约20%),在第七个中基本不变;Pass@1在九对中的七对无显著变化,两个显著差异分别为+12.4和+10.2点。相对把同等算力强制投入主线程自身推理的算力匹配对照,它在对照适用的全部四个设置中以少1.3到3.2倍的顺序解码量取得严格更高的Pass@1。
