论文

ConsistencyGate:基于自洽性准入控制防止LLM智能体的记忆污染

ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control

上下文与知识记忆Agent记忆

摘要

跨多轮运行的LLM智能体在外部记忆库中积累事实,并将其复用为下游推理的前提。因此,某一步写入的幻觉事实会作为错误前提持续影响之后的每一步,我们把这种失败模式称为记忆污染(memory contamination)。现有记忆管理关注检索与容量,却不涉及写入时的正确性;这一准入问题无法用基于效用或新近性的准则解决,而不受控的污染会在长轨迹上不断累积。我们提出ConsistencyGate,一种写入时准入门控:在提交从上下文c提取的候选事实m之前,向LLM查询K次获得软支持分数,只有当平均值超过阈值时才准许m写入。该机制与模型无关、无需微调,在对延迟敏感的部署中还可以通过对数概率变体简化为单次前向传播。为在自然数据上度量其效果,我们通过在来自LoCoMo和MSC的长期对话中植入受控的单细节损坏,构建了两个真实对话基准(LoCoMo-Contam和MSC-Contam),并用一个结构化合成语料(MemContam)加以补充,后者隔离出近神谕(near-oracle)上界。在四个LLM骨干上,ConsistencyGate相对全写入基线在每个基准上都降低了污染,其代价集中在源上下文中仅以隐含方式陈述的事实。我们发布了全部三个基准以及门控实现。

ConsistencyGate:基于自洽性准入控制防止LLM智能体的记忆污染:论文配图
图 1:内存污染和 ConsistencyGate 缓解措施。 (左)基线代理将每个提取的事实写入内存,包括幻觉的事实(红色),然后传播到下游答案。 (右)ConsistencyGate 在每次写入前对验证分数进行 KK 次采样;平均支持度较低的事实会被拒绝,记忆会保持干净。 (下)污染率和下游 QA 准确度与 MemContam 开启时的交互作用 (Qwen2.5-32B-Instruct)。