论文

USA:面向语言Agent跨域on-policy蒸馏的更新感知SAM

USA: Update-aware SAM for Cross-domain On-Policy Disitllation of Language Agents

模型优化模型合并

摘要

on-policy蒸馏通过对学生自己的轨迹进行密集的词元级监督来灌输多轮 agentic 推理,但单个域过早饱和,因此必须从其他域中引入进一步的监督。多域数据混合是合并它们的最直接方式,但代价是数据分布之间存在冲突,并且每当修改一个域时就需要重新训练整个模型。模型合并通过独立地提取每个域并随后融合生成的任务向量来避免这两种情况。相反,我们发现跨域对的好处是两极分化的:在那些表现出负转移的域对上,我们评估的每个合并算子都低于单域参考。我们将此归因于跨域更新耦合,其中很大一部分坐标由两个域进行了相当程度的更新,因此合并可以将它们替换为与它们自己的更新一样多的位置。为了克服这一限制,我们建议 USA,它将短暂预热期间测量的每个参数更新幅度转换为每个坐标的扰动半径,从而精确地减少承载大部分合并位移的坐标上的曲率。在两个学生规模上进行的数学、科学和代码实验表明,美国在所有六个迁移方向上都最强,平均领先单域参考超过四个点,并扭转了冲突对的负迁移。