论文
模型同意,但没有学习:在 大语言模型 中诊断表面顺应性
The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models
摘要
大语言模型 (LLM) 将大量的世界知识内化为参数记忆,但不可避免地继承了源语料库的陈旧性和错误。因此,确保这些内部表示的可靠性和可塑性对于可靠的现实世界部署至关重要。知识编辑为无需重新训练而通过外科手术修改记忆提供了关键范例。然而,尽管最近的编辑在标准基准测试上表现出了很高的成功率,但目前依赖于在特定提示条件下评估输出的评估框架是否能够可靠地验证真正的内存修改仍然值得怀疑。在这项工作中,我们引入了一个简单的诊断框架,该框架在上下文学习(ICL)设置下对模型进行区分性自我评估,更好地反映现实世界的应用环境,专门设计用于仔细检查由记忆修改引起的微妙行为细微差别。这种探索揭示了表面合规性的普遍现象,即编辑人员仅通过模仿目标输出而不从结构上覆盖内部信念来获得高基准分数。此外,我们发现递归修改会积累表征残留,引发认知不稳定并永久降低模型记忆状态的可逆性。这些见解强调了当前编辑范式的风险,并强调了强大的内存修改在构建值得信赖、长期可持续的 LLM 系统中的关键作用。代码可在 https://github.com/XiaojieGu/SA-MCQ 获取。