论文

语言模型编码命题的上下文真相

Language Models Encode the Contextual Truth of Propositions

模型评测模型行为与机制分析

摘要

先前的工作表明,LLM 对激活空间中沿线性方向的事实命题的真实性进行编码。目前尚不清楚这些表示如何扩展到上下文真理:其真实性由上下文证据而不是世界知识决定的命题。我们证明,LLM 保持了上下文真相的线性表示,即使输出不需要模型来确定命题的真相,并通过引导实验显示因果证据,这种线性表示在结构不同的输出策略中仍然存在。使用需要两个 LLM 来保持共同点的协作视觉语言任务的记录,我们表明,即使 LLM 有足够的证据来确定其真实性,命题的真实表示也会受到合作伙伴关于该命题的断言的显着影响。我们发现证据表明,靠近决策边界的命题更容易通过合作伙伴的断言而改变其真相。将表示与输出分开,可以区分两种形式的阿谀奉承,而输出行为本身无法做到这一点:模型可能会容纳一个错误命题,同时继续将其表示为错误,或者将其表示跨越边界。当模型通过明确重述错误声明来表示同意时,后者的发生率比隐式表示同意时的发生率高 2.59 倍。