论文

正确性是一个方向:语言模型中的几何答案选择

Correctness Is a Direction: Geometric Answer Selection in Language Models

模型推理推理验证与自校正

摘要

答案正确性被编码为语言模型隐藏状态中可恢复的几何方向。我们表明,从不正确答案表示到正确答案表示的平均位移(从没有参数更新的 50 个标记示例中计算得出,在模型深度的大约 70% 处计算)产生的评分方向在事实基准(ARC-Challenge 和 MMLU)上优于零样本对数概率评分高达 +32.0 个百分点,在 TruthfulQA 上超过 +38.1 到 +51.8 个百分点,跨越 1B 到 8B 的五个模型参数属于三个架构系列(Llama、Qwen、Gemma)。该方法要求每个候选者进行一次前向传递和一次点积;推理时不执行任何生成。用作个体(问题、答案)对的幻觉检测器,恢复的方向达到 0.693~AUROC,而对数概率评分为 0.578。我们还发现事实推理、领域知识和校准真实性的正确性方向在表示空间中几乎是正交的,这表明语言模型将几何上独立的子空间分配给正确答案的定性不同概念,并在分离程度上具有依赖于体系结构的变化。这种结构解释了观察到的传输模式——根据事实问题校准的方向在任务类型内传输,而不是跨任务类型——并表明LLM校准失败可能反映了路由问题:模型的内部表示包含比其输出行为利用更多的正确性信号。

正确性是一个方向:语言模型中的几何答案选择的原论文方法或结果图
图 2:在 ARC-Challenge、MMLU-Biology 和 TruthfulQA 上针对所有五个测试模型(行)校准的对比正确性方向之间的成对余弦相似性,跨越三个任务方向对(列)。暖色表示正向排列;白色表示正交;值直接在每个单元格中注释。虚线将 sub-3B 型号(上图)与 7B–8B 型号(下图)分开。近正交性 ($|\cos\theta|<0.16$) 是主要模式:Llama-3.2-1B、Qwen-2.5-1.5B 和 Llama-3.1-8B 在所有三对中都满足这一点,其中 Llama-8B 显示出所有测试模型中最强的分离度(最大 $|\cos\theta|=0.10$)。 Gemma-2-2B 显示 ARC 和 TQA ($+0.302$) 之间的部分对齐; Qwen-2.5-7B 显示中等 ARC$\leftrightarrow$MMLU 对齐 ($+0.311$) 和部分 ARC$\leftrightarrow$TQA 对齐 ($+0.166$),表明家族特定的几何组织可以随着规模的增加而增加。