论文

已编码但不可操作:审核冻结 LLM 中几何约束的解码-生成-转向间隙

Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在结构化推理任务上表现出了强大的性能,但它们编码的内容以及它是否通知模型行为仍不清楚。我们通过几何推理来研究这个问题,使用参数化 CAD 约束作为受控测试平台,将局部成对关系与草图级约束状态分开。通过探测六个冻结解码器 LLM 的隐藏状态,我们检查了四个属性:线性可解码性、强制选择生成、激活级别影响和行为可操纵性。预训练极大地改善了局部几何关系的解码,并且在使用打乱顺序控制考虑位置线索后,这种优势仍然存在。相比之下,草图级 DOF 状态已经可以从随机初始化的表示中进行高度解码,并且通过预训练仅略有改善,这表明其大部分探测性能无需学习权重即可获得。进一步的分析表明,可解码的信息并不总是可操作的。生成通常无法表达这些信息,并且在两个经过干预测试的主干上,修补实体位置处的激活恢复效应消失,而可解码性在整个深度上仍然存在。均差控制也不能可靠地控制输出。这些结果表明,解码性、生成、激活级别影响和可操纵性在测试设置中可能会有所不同。审计提供了一种受控方法来区分几何结构编码失败和表达或控制编码信息失败。