论文

ET-Agent:通过行为校准激励有效的工具集成推理 Agent

ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration

模型训练监督微调与指令调优

摘要

大语言模型(LLM)可以通过采用工具集成推理(TIR)范式来扩展其参数知识的边界。然而,现有的基于 LLM 的 Agent 训练框架往往只关注答案的准确性,忽视针对行为模式的特定对齐。因此,Agent 在 TIR 任务中常表现出无效动作,例如冗余和不足的工具调用。如何在执行 TIR 任务时校准错误的行为模式、从而探索有效轨迹,仍是一个悬而未决的问题。本文提出 ET-Agent,这是一个从两个协同视角校准 Agent 工具使用行为的训练框架:自演化数据飞轮与行为校准训练。具体而言,我们引入自演化数据飞轮来生成增强数据,用于微调 LLM 以提升其探索能力。在此基础上,我们实现了一个两阶段的行为校准训练框架,旨在将错误的行为模式逐步校准为最优行为。进一步的深入实验证实了 ET-Agent 在正确性、效率、推理简洁性和工具执行准确率等多个维度上的优越性。我们的 ET-Agent 框架为 TIR 领域的研究提供了实践性启示。代码可在 https://github.com/asilverlight/ET-Agent 获取。

ET-Agent:通过行为校准激励有效的工具集成推理 Agent 配图
图 5:ET-Agent 的总体流程。左侧部分表示自进化数据飞轮(Self-Evolving Data Flywheel),右侧部分表示行为校准训练框架(Behavior Calibration Training Framework)。