论文

ContextWeave:真实工作流基准

ContextWeave: A Real-World Workflow Benchmark

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

记忆对于语言代理而言是至关重要的,它们从孤立的任务转向长期的、状态化的工作流。然而,现有的评估往往将其简化为检索或问题回答。我们引入了ContextWeave基准测试,该基准测试旨在评估通过回忆经验来提高下游代理在现实办公工作流中的性能。ContextWeave将14名参与者的真实办公室工作流重构为1005个可执行的任务,包括568个核心评估任务,并附带指令、容器化环境、轨迹和任务特定的评分标准。它衡量工作空间的质量并与参与者的具体偏好相匹配,同时补充了相关性、连续性、解决能力和对误导性回忆的鲁棒性诊断。在固定模型下,所有六种记忆组件下的最强配置将Workspace Score从68.08提高到78.20,并将Preference Score从41.50提高到70.60。在固定一个记忆组件的情况下,所有五种测试基础模型的回忆都改善了结果,尽管这些改进的程度差异很大。我们的分析表明,行动导向且经验丰富的记忆支持工作流的延续性并减少冗余探索比简短的总结更有效,同时它也可以更容易受到误导性的回忆的影响。这些发现促使优化器不仅要关注检索的相关性,还要在执行过程中可靠地使用记忆。

ContextWeave:真实工作流基准:论文配图
图 1:基准建设管道概览。隐私保护的工作流程注释、前后差异以及可用资源用于推断指令并将任务观察结果重建为本地工件或受控备用 API;然后,每个任务都在隔离的 Docker 环境中执行,根据原始工作日志进行迭代审查,并与其记录的结果保持一致,以为后续任务提供规范状态。