论文
超越检索:长程智能体轨迹的查询条件化复用
Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories
摘要
检索可以找到可能有用的历史轨迹,却不规定在用户、实体、约束或环境状态发生变化之后,执行中的智能体应如何使用该轨迹。我们将这一检索后的复用环节确定为长程轨迹记忆的一个独立瓶颈,并构建了一个评估框架:固定候选检索、目标状态、模型、解码和工具预算,仅改变提供给智能体的支持形式。我们以查询条件化复用(QCR)实例化该框架,这是一种刻意简单的绑定目标的笔记,记录可复用流程、需恢复的绑定、适用条件和验证要求。QCR 的作用是检验复用假设,而非宣称一种普遍优选的记忆格式。在 WebArena、WorkArena 和 AppWorld 的 2,391 个目标实例上,QCR 平均成功率达 62.3%,比完整轨迹高 10.7 个百分点,同时在线 token 少用 48.9%。摘要重排为 94.8% 的目标选中可复用记忆,使端任务成功率与理想可复用选择器相差不到 1.8 个百分点。按轨迹长度和源—目标绑定偏移的分析显示,随着轨迹变长或源特定取值发生变化,直接注入轨迹的效用大幅流失,而绑定目标的支持保留了更大比例的实测增益。由此形成的框架将检索质量与“把检索到的经验转化为新任务安全有用支持”的问题解耦。
