论文
测试 LLM 中真实方向的限制
Testing the Limits of Truth Directions in LLMs
摘要
大语言模型 (LLM) 已被证明可以沿线性真值方向在其激活空间中对语句的真值进行编码。先前的研究认为这些方向在某些方面是普遍的,而最近的研究则对这一结论提出了质疑,因为在某些情况下概括性有限。在这项工作中,我们确定了一些以前未被理解的真理导向普遍性的限制。我们首先表明,真值方向是高度依赖于层的,并且对普遍性的充分理解需要对模型中的多个层进行探索。然后我们表明,真相方向在很大程度上取决于任务类型,在事实任务的早期层中出现,在推理任务中出现在较晚的层中;它们的性能也因任务复杂程度的不同而有所不同。最后,我们证明模型指令可以影响真实方向;简单的正确性评估指令显着影响真值探针的几何结构和泛化能力。我们的研究结果表明,真理方向的普遍性主张比之前已知的更加有限,不同模型层、任务难度、任务类型和提示模板之间存在显着差异。