论文

在线技能和记忆模块总是值得投入词元预算吗?网络代理的预算受限研究

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

智能体系统Agent任务评测Agent Skills

摘要

在线网络代理通常会通过内存、工作流程或技能模块来增强基础参与者。这些模块可以提高性能,但它们也会消耗测试时间词元,这种成本很少与参与者的推理成本一起报告。我们研究在线增强,这种开销是在每项任务上支付的,并在固定的总推理预算下重新评估其好处。我们将 AWM、ASI 和 ReasoningBank 与词元匹配的普通基线进行比较,该基线对额外的参与者步骤使用相同的预算。在四个 WebArena 域和三个模型(Gemini 3 Flash、GPT-5.4-mini 和 Qwen 3.6-27B)中,普通基线在总体成功率方面匹配或超过了所有三种增强方法,同时通常使用更少的总词元。我们在 WorkArena-L1 和 Qwen 3.6-27B 上观察到类似的趋势,表明这种影响延伸到了企业知识工作任务。我们的结果表明,技能和工作流程记忆在特定领域可能很有用,但对于预算匹配的参与者来说,它们的明显收益往往会消失。我们进一步表明,运行间差异会对结果产生重大影响,应将其报告为在线网络代理的核心评估标准。