论文

AutoTool:经由解耦熵约束实现RL中工具使用能力的自动扩展

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

模型训练强化学习Agentic RL

摘要

工具使用是AI Agent的关键能力,近期进展聚焦于利用强化学习(RL)扩展显式推理过程以取得更好性能。然而,当前基于RL的扩展方法在工具使用上存在一些关键挑战:(a)直接RL训练常难以充分扩展思考长度以解决复杂问题,(b)扩展后的模型倾向于在较简单问题上过度思考,造成大量token低效。为应对这些挑战,我们提出一种新的训练范式:先采用热身监督微调帮助模型区分简单与复杂问题,再进行RL使模型能够自动确定合适的推理轨迹。此外,为解决思考长度自动扩展问题,我们发现基于熵的优化目标能在有效保持模型多样性的同时成功解锁模型的扩展能力。基于这一洞见,我们引入基于熵的长短推理融合RL策略。我们在三个基准上的实验表明,模型成功实现了高效工具使用的自动扩展,在显著提升9.8%准确率的同时将计算开销降低约81%。

AutoTool:经由解耦熵约束实现RL中工具使用能力的自动扩展
图4:解耦自适应熵约束概览。它通过施加差异化的熵约束来解耦不同的推理模式,从而实现自动伸缩。面向长推理的自适应熵约束强度。在推理过程中,模型可以通过在输入token前拼接一个响应前缀,自动或可控地切换推理模式。