面向智能体记忆的可靠检索后组装:分离证据抽取与答案生成
Reliable Post-Retrieval Assembly for Agent Memory: Separating Evidence Extraction from Policy Execution
摘要
基于 LLM 的记忆系统可以检索相关证据,但当答案生成在一步中涉及语义过滤、冲突解决、先验抑制和输出生成时,仍然会失败。我们将这种失败视为检索后组装的问题来研究。在此使用的 MemoryAgentBench (MAB) 版本中,FactConsolidation 明确指出较新的事实具有更大的序列号,但报告的最佳检索/内存结果为 54% 单跳,所有 22 个报告的系统得分最多为 7% 多跳。我们评估了一个结构化装配接口,其中大语言模型首先将语义匹配的证据提取到候选表示中,然后由一个单独的阶段执行所需的答案策略。在 262K 时,该管道使用 gpt-4o-mini/gpt-4o 达到 82%/93% 单跳和 27%/41% 多跳,超过了 MAB v3 FactConsolidation 比较中报告的所有结果。这是任务级结果,而不是声称评估的内存架构普遍较差。受控的全管道比较,具有相同的主干,检索前 10 个证据,分块,每个单元 n=100,单跳准确率平均提高 10.8 个百分点 (pp),在 262K 时提高 21 个百分点。使用相同提取设置的有针对性的比较表明,仅更改最终策略执行器平均贡献 2.0 pp,在 262K 时贡献 0 pp。因此,大部分收益来自于将证据识别与最终政策执行分开,而不是来自新鲜度运营商本身。 LongMemEval 检查没有发现显着的总体优势(26/45 与 29/45;配对的精确 McNemar p=0.45),将结果限制为具有显式版本元数据的当前值问题。证据表明检索后组装是检索和答案生成之间明显的可靠性边界。