论文

管理LLM智能体中的过程记忆:控制、适配与评估

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

智能体系统上下文与知识记忆Agent任务评测Agent SkillsAgent记忆

摘要

过程记忆日益用于改进LLM智能体在重复职场任务上的表现——但其产出可复用技能的能力仍知之甚少。我们介绍AFTER——382个真实企业任务、横跨六个职业角色与22项过程技能的基准——设计用于评估技能如何跨任务、角色与模型骨干迁移。基准含局部改进、跨任务迁移、跨角色迁移与跨模型泛化的受控评估设定。实验表明过程记忆在工业工作流中带来一致增益:单轮精化使聚合性能提升3.7-6.7分——而从多样多模型执行踪迹演化的技能达到73.1%跨模型测试准确率——超越全部单模型踪迹来源。我们进一步发现:一些技能跨任务与模型广泛泛化——另一些则特化于角色专属工作流并在迁移下失效。这些结果为在生产智能体平台中构建、评估与部署过程记忆系统提供实践指导。

管理LLM智能体中的过程记忆:控制、适配与评估:论文配图
图 2:之后概览。 (a) 涵盖六个专业角色和五个能力领域的角色技能矩阵;红色边框表示四个角色共享的技能。 (b) 任务来源:56 个改编任务和 326 个新编写的任务。 (c) 按角色分配单技能和多技能任务。 (d) 跨任务、角色和模型转移评估。 (e) 跨角色转移和特定角色技能专业化。