论文

ServeLearnBench:Agent 如何从服务经验自我改进?

ServeLearnBench: How Well Can Agents Self-Improve from Serving Experience?

智能体系统Agent任务评测

摘要

大语言模型智能体越来越多地被部署来在现实环境中执行复杂的任务。然而,在这些环境中正确行为所需的知识通常是隐性的、未公开的,并且会随着时间的推移而发生变化。最近的持续学习 Harness 寻求通过使智能体改善服务体验来应对这一挑战。然而这些方法的有效性和局限性尚未得到很好的表征。现有的基准仅提供部分覆盖:一些明确提供目标知识,另一些假设静态环境,而那些支持持续适应的基准在规模和知识多样性方面仍然有限。为了实现系统评估,我们形式化了一个不断演变的环境流数据集 (EESD),其中智能体必须随着隐藏的策略的演变,从交互和结果反馈中推断、应用和修改潜在环境知识,并引入 ServeLearnBench,涵盖零售支持、银行业务和销售推介生成,具有 53 个环境窗口和 7,718 个任务。我们评估了六个模型(GPT-5.6 Terra、Opus 5、Kimi K3、GLM-5.3、DeepSeek V4.1 Flash 和 GLM-5.3 Flash)的五种学习 Harness(RAG、Mem0、SkillOpt、Continual Harness 和 Prime),涵盖 28 个模型-Harness 对和 252 次学习运行。我们的评估揭示了三个主要发现:任务能力和从经验中学习之间仍然存在巨大差距;持续的适应代价高昂,并且可能会降低已经正确的行为;探索不足成为有效适应的关键瓶颈。总体而言,ServeLearnBench 提供了一个受控测试平台,用于诊断这些限制并跟踪智能体的进度,从而通过服务体验持续可靠地改进。

ServeLearnBench:Agent 如何从服务经验自我改进?:论文原图
图 2:ServeLearnBench 协议。顶部:流被划分为环境窗口,每个窗口包含提供反馈的服务任务,后面是隐藏反馈的测试任务。窗口 $s$ 中的活动策略由行为组件 $\mathcal{C}(\theta_{s})$ 组成,可以引入、撤回或重新激活(虚线)。左下:学习者既不会收到策略组件描述,也不会收到更正,并且必须从服务交互和结果反馈中推断出活跃的策略。右下:跨域、层、窗口和任务的基准规模。