论文
重新思考熵在大语言模型智能体工具使用行为优化中的作用
Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
摘要
基于大语言模型(LLM)的工具使用智能体在数学推理、多跳问答等任务中表现出色。然而在长轨迹中,智能体经常触发过多且低质量的工具调用,增加延迟并损害推理性能,使工具使用行为的管理颇具挑战。在本工作中,我们开展基于熵的先导实验,观察到熵下降与高质量工具调用之间存在强正相关。基于这一发现,我们提出将熵下降用作监督信号,并设计两种奖励策略以应对工具使用行为优化的不同需求:稀疏的结果奖励提供粗粒度的轨迹级指导以提升效率,而密集的过程奖励提供细粒度监督以增强性能。跨多个领域的实验表明,两种奖励设计都能改善工具使用行为:前者相比基线平均值减少72.07%的工具调用,后者将性能提升22.27%。这些结果把熵下降确立为增强工具使用行为的关键机制,使智能体在真实应用中更具适应性。
