论文

重置不是恢复:通过谄媚滞后评估虚假对话上下文的可恢复性

Reset Is Not Recovery: Evaluating Recoverability from False Conversational Context via Sycophancy Hysteresis

模型评测鲁棒性、公平性与可信度评测

摘要

扎根语言模型通常通过添加相关上下文来评估,但多轮对话还包含不受支持的用户声明,可能会影响后续的事实答案。我们研究压力后的可恢复性:在用户反复提出错误答案然后撤回压力后,模型是否会返回到干净环境行为。我们引入了用于多项选择事实对话的压力后恢复协议,并测量谄媚滞后,即相对于干净上下文反事实分配给用户主张的错误答案的剩余概率。在七个指令调整的开放权重模型和两个事实基准中,普通重置通常会减少但不能消除压力引起的偏差。在严格的清理恢复诊断下,历史保留修复(例如用户撤消、系统重置和自我验证)仅恢复 2-3/14 模型数据集对,而更改有效上下文的操作要可靠得多;完全删除承压历史的两个条件,新鲜上下文删除和上下文截断,恢复到14/14。在 14 个模型-数据集对的预言机可信证据条件下,保留承压历史,同时添加基准导出的可信证据,可将准确性从 0.368 提高到 0.929,而错误答案率从 41.2% 下降到 4.3%。对照显示,这种效果不能用对话长度、重复置信度、看似合理的干扰因素、仅仅提及错误答案或选项标签惯性来解释。这些结果表明,忠实的基础对话需要评估哪些先前的背景应该被视为证据,哪些应该在回答之前删除或隔离。