论文

记得太好:记忆增广模型中的谄媚评估与缓解

Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

持久记忆系统有望通过随着时间的推移存储用户的信念而使大语言模型更有帮助。我们表明,它们还通过放大阿谀奉承来降低模型的正确性,其中模型优先考虑与用户的同意而不是准确性。我们对这种效应进行了首次系统评估,引入了 MIST:综合生成的多轮对话的基准,用户在其中表达科学、医学和道德推理领域中看似合理的误解。对三个最先进的记忆系统和五个模型系列的测试表明,记忆会在所有条件下放大阿谀奉承行为,与上下文基线相比,阿谀奉承率高出 40%。错误分析表明,内存提取是罪魁祸首:仅对用户的离散片段进行有损压缩,会编码用户的误解,同时丢弃正确的上下文。基于这些结果,我们提出了对记忆系统的三种轻量级缓解措施,这些措施可以显着减少阿谀奉承,同时在实际回忆中匹配或超过记忆系统。

记得太好:记忆增广模型中的谄媚评估与缓解:论文配图
图 1:使用记忆会导致阿谀奉承:在这里,偏离正确答案。