论文

重新思考熵在大语言模型智能体工具使用行为优化中的作用

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

模型训练奖励建模与过程监督

摘要

基于大语言模型(LLM)的工具使用智能体在数学推理、多跳问答等任务中表现出色。然而在长轨迹中,智能体经常触发过多且低质量的工具调用,增加延迟并损害推理性能,使工具使用行为的管理颇具挑战。在本工作中,我们开展基于熵的先导实验,观察到熵下降与高质量工具调用之间存在强正相关。基于这一发现,我们提出将熵下降用作监督信号,并设计两种奖励策略以应对工具使用行为优化的不同需求:稀疏的结果奖励提供粗粒度的轨迹级指导以提升效率,而密集的过程奖励提供细粒度监督以增强性能。跨多个领域的实验表明,两种奖励设计都能改善工具使用行为:前者相比基线平均值减少72.07%的工具调用,后者将性能提升22.27%。这些结果把熵下降确立为增强工具使用行为的关键机制,使智能体在真实应用中更具适应性。

重新思考熵在大语言模型智能体工具使用行为优化中的作用
图2:TEPO sparse(\text{TEPO}_{\text{sparse}})与 TEPO dense(\text{TEPO}_{\text{dense}})的总体框架。在稀疏奖励设计中,先计算奖励和优势,然后将其均匀分配给轨迹内的每个 token(所有 token 的 A_{i,t} 相同)。相比之下,密集奖励设计分配细粒度的工具奖励和优势,使得同一轨迹内不同 token 的 A_{i,t} 值各不相同。