论文
并非所有回合都同样困难:智能体中高效多回合推理的自适应思维预算
Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents
摘要
由于 LLM 推理性能趋于稳定,提高推理时间计算效率对于减轻过度思考和长时间思考轨迹至关重要,即使对于简单的查询也是如此。先前的方法,包括长度正则化、自适应路由和基于难度的预算分配,主要关注单轮设置,未能解决多轮推理中固有的顺序依赖性。在这项工作中,我们将多轮推理表述为顺序计算分配问题,并将其建模为多目标马尔可夫决策过程。我们提出TAB:轮次自适应预算,这是一种通过组相对策略优化(GRPO)训练的预算分配策略,它可以学习最大限度地提高任务准确性,同时尊重每个问题的全局词元约束。因此,TAB 将对话历史记录作为输入,并学习自适应地将较小的预算分配给更容易的回合,并为关键的更难的推理步骤保存适当数量的词元。我们对各种代理基准的实验表明,TAB 实现了卓越的准确性与成本权衡,节省了高达 35% 的词元,减少了高达 30% 的延迟,同时保持了静态和现成 LLM 预算基准的准确性。此外,对于所有回合计划均可用的系统,我们提出 TAB All-SubQ,这是一种预算分配策略,可根据对话历史记录和整个计划来预算词元,比基线节省高达 40% 的词元。