论文
Agent应该何时思考?通过交叉转弯估计进行自适应推理
When Should Agents Think? Adaptive Reasoning via Cross-Turn Estimation
摘要
基于大型语言模型(LLM)的代理在复杂任务上表现出了强大的能力。他们通常在整个交互轨迹中的每个动作之前进行推理。然而,推理并不是每次都需要,因为之前产生的推理可以继续支持后续的行动。因此,一个关键的挑战是确定何时现有推理仍然足够以及何时需要新的推理步骤,而不依赖于昂贵的基于生成的验证。我们发现,在删除额外推理后,后续参考动作的可能性会降低,密切跟踪这些动作在给定早期推理的情况下是否仍然可恢复,为估计交叉转弯动作支持提供了有效且轻量级的信号。基于这一观察,我们提出了通过交叉回合估计进行推理适应(RACE),这是一种自适应代理推理的训练方法。 RACE 引入了似然引导的渐进推理覆盖检测 (LoGiC) 程序,该程序逐步识别推理回合,其删除对推理回合的影响有限。 当前和后续参考操作。由此产生的移除信号被纳入监督微调和 agentic 强化学习中,使策略能够学习何时推理以及何时直接采取行动。对四个代表性代理基准的广泛实验表明,RACE 显着降低了推理成本,同时保持或提高了任务性能。