论文

TRACER:通过结果归因强化学习实现大语言模型智能体的逐工具上下文保留

TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning

上下文与知识模型训练强化学习上下文工程Agentic RL

摘要

企业数据代理通过在多个推理步骤上链接许多工具调用来回答业务查询,通常在每个会话中积累数十万个上下文令牌。现有的压缩策略通常分配保留预算,而不考虑删除单个工具输出的下游后果。因此,激进的压缩可能会触发成本高昂的工具重新调用,从而抵消最初的节省。我们称之为压缩后果差距。为了解决这个问题,我们提出了 TRACER,它将压缩制定为每个工具的顺序决策问题。轻量级 REINFORCE 策略仅使用每个压缩事件中可用的信息来分配查询条件保留率。其后果意识目标共同考虑任务成功、总令牌消耗和压缩后工具重新调用。为了改进信用分配,TRACER 使用学习结果模型来比较所选保留率的预测结果与完全保留每个工具输出的结果。在跨三个压缩机后端的保留生产查询中,相对于保留所有上下文,TRACER 将总令牌消耗减少了 29--46%,同时保持可比或更高的任务成功率。与工具型条件静态策略相比,TRACER 额外提供 15--18% 的token节省。干预措施的推出表明,学习到的每种工具的信用评分与测量的单一工具的后果相关。当跨代理主干和压缩器架构传输时,学习到的策略还可以产生积极的节省,并在五个保留的 LOCA 基准环境中将令牌消耗减少 18--25%。这些结果证明了后果感知、每个工具上下文保留对于提高长视野语言代理效率的价值。

TRACER:通过结果归因强化学习实现大语言模型智能体的逐工具上下文保留:论文配图
图1 压缩后果差距。随着压缩的力度加大,石块成本下降,但总成本也占下游重新启用的原因。