论文
DART-SD:多轮工具调用代理的自 蒸馏 的钻石拓扑感知检索和调整
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
摘要
为 大语言模型 (LLM) 配备多轮工具调用功能对于构建自主代理至关重要。然而,对全长轨迹模拟的依赖从根本上限制了进展。对于涉及多个与阶无关的子目标的任务,最优解空间形成一个巨大的组合菱形格子。迫使这种丰富的拓扑进入整体轨迹会导致严重的拓扑崩溃,不加区别地惩罚有效的替代探索并严重降低政策多样性。为了解决这个问题,我们提出了 DART-SD(Diamond-topology Aware Retrieval and Tuning for Self-蒸馏),这是一种新颖的框架,将范式从全局强制转变为拓扑引导的局部校正。 DART-SD 首先将执行过程建模为聚合交互状态转换图 (ISTG),忠实地捕获成功和失败探索路径的固有菱形拓扑。在自主执行轨迹期间,该框架会识别关键拓扑断点 (CTB) 并检索成功支持的恢复引用。最后,我们通过 CTB 引导的局部监督引入了渐进式自 蒸馏 范式,确保训练损失仅在生成的恢复步骤上计算,同时严格保护有效推理前缀免受破坏性梯度更新的影响。对复杂多轮工具调用基准的实验表明,DART-SD 显着优于传统的全轨迹基准。