论文
在压抑与崩溃之间:用 LENS 评估叙事遗忘
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
摘要
大语言模型 (LLM) 可以重现虚假信息一致的叙事框架作为合理的解释,从而提出了现有的机器学习算法是否可以抑制这种行为的问题。我们引入了基于级别的叙事抑制评估(LENS),这是一种基于情境化的评估协议,用于测试跨直接、归因、对比和抽象阻力级别的目标叙事再现。我们评估两种基于来源的叙述:一种将俄罗斯对乌克兰的战争视为北约扩张所迫,另一种将美国视为剥削或放弃台湾。实验涵盖四种近12B多语言教学模型:Lapa LLM、Gemma-12B、Qwen-14B和TAIDE-Gemma。我们引入抑制崩溃效率(SCE)分数作为检查点选择摘要,奖励目标叙事抑制,同时惩罚退化的输出。我们的结果表明,选定的检查点可以减少叙事复制,而抑制可能会超越直接的遗忘提示。我们还将实体恢复报告为单独的副作用:抽象 A/B/C 提示可能会导致模型在忘记学习后恢复与目标框架关联的现实世界参与者。这些发现表明,LENS 是一种成功的诊断方案,可用于报告和指导对叙事遗忘的更深层次结构的进一步研究。