论文
从多智能体到单智能体:技能蒸馏何时有益?
From Multi-Agent to Single-Agent: When Is Skill Distillation Beneficial?
摘要
多代理系统(MAS)通过分配专业知识来处理复杂的任务,尽管这通常以大量的协调开销、上下文碎片和脆弱的阶段排序为代价。将 MAS 提炼为单代理技能可以绕过这些成本,但这种转换缺乏关于何时提炼和提炼什么的原则性答案。相反,实证结果却出人意料地不一致:在完全相同的任务指标中,技能提升从 28% 的提高到 2% 的下降不等。在这项工作中,我们揭示了技能效用不是由任务决定的,而是由评估指标决定的。我们引入度量自由($F$),第一个技能效用的先验预测因子。 $F$ 通过曼特尔测试量化输出多样性与分数方差的耦合方式,来衡量指标评分格局的拓扑刚性。在$F$的指导下,我们提出了一个两阶段自适应蒸馏框架。第一阶段充当选择性提取机制,提取工具和知识,同时放弃“自由”指标的限制性结构以保留探索。第 2 阶段的目标是专门针对“刚性”指标($F \lesssim 0.6$)进行计算密集型迭代细化,以消除轨迹局部过度拟合。通过评估 4 个任务、11 个数据集和 6 个指标,$F$ 强烈预测技能效用($\rho = -0.62$,$p < 0.05$)。引人注目的是,在严格指标与自由指标下,相同的代理轨迹会产生截然相反的技能提升,这表明技能效用从根本上来说是指标级别的属性。在此信号的驱动下,我们的自适应代理匹配或超过了原始 MAS,同时将成本降低高达 8$\times$,并将延迟降低高达 15$\times$。
