论文

认识论护目镜:经梯度编辑诱导认识框架的预训练模块

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

模型训练监督微调与指令调优

摘要

在显式标注为虚构的文档上微调语言模型——所得模型仍然真的相信文档的核心声明——这一效应被称为否定忽略(Negation Neglect)。在我们的评估中——在以此类标注前置与后缀的文档上训练的模型仅约9%的时候正确识别相关声明为虚构。为解决此问题——我们介绍Goggles——在微调梯度而非数据上干预的学习模块。在监督微调期间——Goggles模块编辑LLM LoRA接收的梯度——将选定的认知框架(模型对其所读内容性质采取的立场)赋予文档所教的一切。Goggles实例针对给定基座模型、框架与LoRA配置训练一次——随后冻结应用于从未训练过的文档。经Goggles在同一批文档(不再携带虚构标注)上训练——模型约91%的时候将内容标记为虚构——同时保持能力(GPQA与TruthfulQA持平或超过基线)。同一架构支持其他框架:Goggles实例可被训练为将文档视为Redwood Research AI安全评估的一部分——而非简单视为虚构。被赋予的框架在继续微调回推声明时持续存在——而既有干预会回退。Goggles提示一条路径:在已知失对齐数据上训练语言模型而不吸收该数据展示的行为。