论文

AdaptR1:多跳问答中基于强化学习的自适应交错思维

AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering

模型推理测试时计算扩展

摘要

大语言模型(LLM)通过思想链(CoT)提示在复杂推理任务中取得了出色的表现。然而,这种方法通常会导致“过度思考”,模型会为简单查询生成不必要的长推理轨迹,并产生可避免的推理成本。虽然最近的工作已经探索了自适应推理,但现有方法通常会就是否推理做出单一查询级决策。这忽视了多步骤任务的动态性质,其中对显式推理的需求在不同的中间阶段是不同的。为了解决这一限制,我们引入了 AdaptR1,这是一种基于强化学习 (RL) 的框架,用于多跳问答 (QA) 中的自适应交错思维。与之前需要监督 微调 (SFT) 进行冷启动初始化的方法不同,AdaptR1 使用完全基于 RL 的策略以及质量门控效率奖励,在每一步动态分配推理预算。在 Graph-R1 设置下,AdaptR1 将平均思考标记减少了 69.71%,HotpotQA 减少了 90.35%,同时保持与标准基线相当或更好的性能。此外,我们的分析表明,多跳推理中的过度思考并不是均匀分布的,而是主要发生在初始规划阶段,这凸显了逐步自适应预算分配的有效性。