论文
通过分歧点偏好学习的多轮工具调用代理的自我进化
Self-Evolution for Multi-Turn Tool-Calling Agents via Divergence-Point Preference Learning
摘要
使用多轮工具的代理必须协调长视野工具序列,同时跟踪对话状态和策略约束。现有方法通常将推理时间编排与参数级学习分开,导致工具选择结构较弱,偏好更新容易受到训练-部署提示不匹配的影响。为了在基准内进行自我改进,ToolGraph 结合了模式派生拓扑、从成功执行轨迹中估计的转换权重以及用于写入先决条件和重复搜索循环的历史感知控制。然后,我们通过基于状态的匹配和基于前缀的对齐来定位分歧点,通过动作正确性注释进行过滤,构建 161 个偏好对,并在推理时使用的相同 ToolGraph 上下文下训练 DPO。在 375 个 tau2 基准任务中,ToolGraph 将加权平均奖励从 0.304 提高到 0.338(相对增加 11.2%),而 ToolGraph+DPO 达到 0.355(比基线增加 16.8%),DPO 收益主要集中在航空和零售业。细粒度诊断进一步表明,大约一半的电信轨迹在执行操作之前耗尽了步骤预算,并且所选择的奖励积极性是我们评估的 16 个 DPO 配置中最有用的检查点信号。