论文
管理LLM智能体中的过程记忆:控制、适配与评估
Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
摘要
过程记忆日益用于改进LLM智能体在重复职场任务上的表现——但其产出可复用技能的能力仍知之甚少。我们介绍AFTER——382个真实企业任务、横跨六个职业角色与22项过程技能的基准——设计用于评估技能如何跨任务、角色与模型骨干迁移。基准含局部改进、跨任务迁移、跨角色迁移与跨模型泛化的受控评估设定。实验表明过程记忆在工业工作流中带来一致增益:单轮精化使聚合性能提升3.7-6.7分——而从多样多模型执行踪迹演化的技能达到73.1%跨模型测试准确率——超越全部单模型踪迹来源。我们进一步发现:一些技能跨任务与模型广泛泛化——另一些则特化于角色专属工作流并在迁移下失效。这些结果为在生产智能体平台中构建、评估与部署过程记忆系统提供实践指导。
