论文
正确性是一个方向:语言模型中的几何答案选择
Correctness Is a Direction: Geometric Answer Selection in Language Models
摘要
答案正确性被编码为语言模型隐藏状态中可恢复的几何方向。我们表明,从不正确答案表示到正确答案表示的平均位移(从没有参数更新的 50 个标记示例中计算得出,在模型深度的大约 70% 处计算)产生的评分方向在事实基准(ARC-Challenge 和 MMLU)上优于零样本对数概率评分高达 +32.0 个百分点,在 TruthfulQA 上超过 +38.1 到 +51.8 个百分点,跨越 1B 到 8B 的五个模型参数属于三个架构系列(Llama、Qwen、Gemma)。该方法要求每个候选者进行一次前向传递和一次点积;推理时不执行任何生成。用作个体(问题、答案)对的幻觉检测器,恢复的方向达到 0.693~AUROC,而对数概率评分为 0.578。我们还发现事实推理、领域知识和校准真实性的正确性方向在表示空间中几乎是正交的,这表明语言模型将几何上独立的子空间分配给正确答案的定性不同概念,并在分离程度上具有依赖于体系结构的变化。这种结构解释了观察到的传输模式——根据事实问题校准的方向在任务类型内传输,而不是跨任务类型——并表明LLM校准失败可能反映了路由问题:模型的内部表示包含比其输出行为利用更多的正确性信号。
