论文

基于三信号互补的 LLM 代理的可解释内存决策控制器:解耦置信度和一致性

An Interpretable Memory Decision Controller for LLM Agents Based on Three-Signal Complementarity: Decoupling Confidence and Consistency

摘要

大型语言模型的记忆系统主要关注高效检索,而检索到的记忆是否应该可信的决定却受到相对较少的关注。当记忆存储包含冲突位置时,标准检索增强生成(RAG)会盲目注入记忆并放大幻觉:在易受记忆注入影响的模型中,冲突记忆下的RAG幻觉率明显高于无记忆基线。受前额皮质记忆信号机制的启发,我们提出了记忆决策层(MDL),这是一个位于检索和生成阶段之间的零参数记忆决策控制器。其核心是一个三信号互补编码器,通过基于 QR 的正交子空间投影和元工作记忆信号将相关性、可靠性和任务风险融合到可解释的决策表示中,从而量化检索到的记忆的可信度。在此编码器的基础上,MDL 明确地将置信度与一致性解耦,并引入风险倒置和明确弃权。对主流大语言模型和多个开源数据集的评估表明,MDL在一般场景下使冲突记忆下的幻觉率降低约56.04%,在高风险场景下接近零幻觉。该控制器是完全白盒的:它纯粹依赖于几何运算,不需要经过训练的参数,并且每个决策仅增加约 0.14 毫秒——比之前的嵌入检索步骤快大约 50 倍,比 LLM 自评估调用快四到五个数量级。