论文

知识访问胜过模型大小:持久 AI 代理的内存增强路由

Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents

摘要

生产 AI 代理经常收到高度重复的特定于用户的查询,其中高达 47% 的查询在语义上与之前的交互相似,但每个查询通常都以相同的计算成本进行处理。我们认为,这种冗余可以通过会话记忆来利用,将重复从成本负担转变为效率优势。我们提出了一种内存增强推理框架,其中轻量级 8B 参数模型利用检索到的会话上下文通过低成本推理路径回答所有查询。在没有任何额外的训练或标记数据的情况下,该方法实现了 30.5% F1,恢复了全上下文 235B 模型的 69% 性能,同时将有效成本降低了 96%。值得注意的是,没有内存的 235B 模型 (13.7\% F1) 甚至比独立的 8B 模型 (15.4\% F1) 表现也差,这表明对于用户特定的查询,获取相关知识比模型规模更重要。我们进一步分析路由和置信度的作用。在实际的置信度阈值下,单独的路由已经将 96\% 的查询定向到小模型,但由于置信幻觉,准确度较差 (13.0\% F1)。内存不会显着改变路由决策;相反,它通过将响应基于检索到的用户特定信息来提高正确性。随着会话记忆随着时间的推移而积累,重复出现的主题的覆盖范围也会增加,从而进一步缩小性能差距。我们评估了 152 个 LoCoMo 问题 (Qwen3-8B/235B) 和 500 个 LongMemEval 问题。结合混合检索(BM25 + 余弦相似度)将性能提高了额外的 +7.7 F1,表明检索质量直接增强了端到端系统性能。总体而言,我们的结果强调,内存(而不是模型大小)是持久人工智能代理准确性和效率的主要驱动因素。