论文

SHarP:智能体Harness的基于显着性的剪枝

SHarP: Saliency-based Pruning of Agent Harnesses

智能体系统上下文与知识上下文工程Agent Harness

摘要

智能体Harness是协调模型调用、工具使用和任务执行的系统,以帮助大语言模型完成复杂的任务。为了满足任务要求并解决故障,这些系统通常通过修改和修补其指令、工具和工作流程来迭代完善,从而不断增加Harness的复杂性。因此,尚不清楚一些最终的Harness模块是否是冗余的,从而引入大量的token开销,而几乎没有性能增益(如果有的话)。受神经网络剪枝的启发,在本文中,我们研究Harness剪枝作为任务性能和token成本之间取得更好平衡的一种手段。我们提出了 SHarP(基于显着性的Harness剪枝),这是一种简单而有效的剪枝策略,基于每个Harness模块在性能和效率方面的显着性。具体来说,我们首先将工具、指令和支持机制识别为可以单独禁用的组件。然后,我们通过消融每个模块并评估其任务性能和相对于全套单模块消融的token成本来估计每个模块的显着性。随后对性能贡献最小或计算开销最大的模块进行修剪。我们对留出验证集上的各种Harness进行的评估揭示了一个令人惊讶的发现:我们研究的大多数Harness都具有高度冗余性,即使在其大部分模块被修剪后也能保持相当的性能和效率。我们的剪枝方法和实证研究结果为智能体Harness设计和优化提供了新的视角。

SHarP:智能体Harness的基于显着性的剪枝的原论文方法或结果图
图 1:SHARP 以效率为导向的修剪概述。单模块消融估计性能和效率显着性,分别确定受保护模块集(绿色)和修剪顺序。评估剪枝配置和全剪枝基线的任务性能和token成本。