论文

Skill Blocks:智能体应如何加载其技能?预加载、按需工具加载、渐进披露与混合方式的缓存正确比较

Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-load, On-Demand Tool-Loading, Progressive Disclosure, and Hybrid

智能体系统Agent HarnessAgent Skills

摘要

智能体技能常在每次请求时全量注入,增加token成本。我们比较四种保持内容不变的加载方法:Full、Skill Block、Reference和Hybrid。在SearchQA、SpreadsheetBench、ALFWorld、ScienceWorld和SynthProc上,我们用单轮任务的原始输入和多轮任务的缓存正确有效输入来测量token使用。结果显示没有普适赢家。Hybrid在SearchQA上减少27.4%输入,在SpreadsheetBench上减少39.8%。在大型多轮技能上,Skill Block和Hybrid实现大幅削减,在ScienceWorld上分别达到62.5%和52.8%,在SynthProc上达到73.0%和66.6%。ALFWorld收益较小,因为流程短且被反复需要。配对结果检验未发现质量差异,但也不能据此确立等价性。总体而言,当技能的大部分内容并非每一轮都需要时,条件化加载最有利。