论文

几何偏差作为无监督的预生成可靠性信号:探测 LLM 表示的可回答性

Geometric Deviation as an Unsupervised Pre-Generation Reliability Signal: Probing LLM Representations for Answerability

模型评测模型行为与机制分析

摘要

当查询超出其知识范围时,可靠的语言模型应该能够在生成之前发出信号。我们通过测量隐藏状态与可回答参考集的偏差来研究表示几何是否可以提供这样的预生成信号,不需要标记的故障数据并且不需要访问模型输出。在三种指令调整模型(Llama 3.1-8B、Qwen 2.5-7B 和 Mistral-7B-Instruct)和三种提示形式(数学、事实、代码)中,我们发现几何主要对任务形式进行编码。在数学提示内,无法回答的输入始终偏离可回答的质心,产生很强的分离(ROC-AUC 0.78-0.84)。这种单通道预生成信号的性能优于简单的拒绝基线,并且与自一致性相比具有优势。它还捕获模型未明确拒绝的情况。相比之下,没有出现可靠的几何信号作为事实提示,这表明效果是形式条件的而不是普遍的。代码提示显示出较大的效应量和较高的方差,表明超出数学形式的部分概括。逐层分析表明,信号出现在早期层并逐渐衰减到输出。这些结果表明,与可回答性相关的几何结构是在生成的最后阶段之前建立的。总之,这些发现表明,几何偏差可以作为轻量级的预生成信号,在具有正式可回答性约束的结构化领域中是可靠的,并且其概括范围具有明确的边界。