论文
零内存:LLM 代理的零词元内存操作
Zero-Mem: Zero-Token Memory Operations for LLM Agents
摘要
LLM 代理需要内存才能在长时间交互中保持一致的行为,但许多系统使用额外的 LLM 调用来操作该内存。生成中间记录并调解其检索会增加重复出现的标记和时间成本,而省略或合并的细节可能会掩盖原始证据。我们询问结构化内存访问是否需要生成。 Zero-Mem 引入了 \emph{零词元内存操作}:最终问答之外的任何步骤都不会调用 LLM 或消耗 LLM 输入或输出词元;编码器计算是单独考虑的。零内存保留原始交互痕迹作为其记录来源。它以两种互补的方式组织痕迹。实体-上下文图公开交互之间的连接,而时间层次结构保留会话局部性和会话状态。对于每个查询,Zero-Mem 都会权衡两个视图,从两个视图中检索,并遵循它们的结构来恢复支持关系或周围上下文。确定性校准首先丢弃相互矛盾的证据,然后使读者的答案基于检索到的痕迹。只有最终 QA 阅读器才会调用 LLM。在长内存和长上下文问答基准测试中,Zero-Mem 实现了具有竞争力的性能,同时消除了内存操作中的 LLM 调用和 LLM 词元消耗。在相同的最终 QA 阅读器和上下文预算的情况下,相对于最快的比较基准,它可以将内存操作时间成本降低 57.6%。消融支持两种视图的贡献及其依赖于查询的协调。总的来说,结果表明结构化代理记忆不需要生成过去的中间表示。经过同行评审后,代码和实现细节将在 \textcolor{blue}{https://github.com/TheMoon0815/Zero-mem} 中提供。