论文

用于高效多轮代理微调的依赖性感知轨迹细化

Dependency-Aware Trajectory Refinement for Efficient Multi-Turn Agent Fine-Tuning

模型训练合成数据

摘要

多轮代理轨迹通常包含冗余轮次(失败的工具调用、并行子查询、仅验证步骤),这会增加训练和推理成本。我们建议将每个轨迹视为 \emph{round-level dependency DAG},它公开哪些轮次全局承载最终答案,并在通过该 DAG 细化的轨迹上微调代理。给定 LLM 注释的 DAG,这些编辑是确定性的、可解释的,并且可以选择重新措辞。在这些精炼轨迹上训练的模型始终优于在原始轨迹上训练的模型,且推理成本较低。具体来说,在四个多模态 QA 基准测试中,我们的改进将下游准确度比普通 SFT 提高了高达 1.7$\,pp(与 LLM 删除基线相比提高了 5.7$\,pp),同时将每个样本的推理消息减少了大约 40\%$,将推理词元减少了大约 48\%$,从而大大节省了计算和服务成本。代码可用。