论文

语言模型的测谎试验:读取模型不愿透露的知识

A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

模型评测评测方法与指标

摘要

大语言模型可能持有其不报告的知识。模型可能在能力评测中消极表现(sandbagging),或给出与内部认知相悖的回答,而仅凭其输出无法判断它是在隐藏答案还是根本没有答案。我们借鉴法医学中的隐蔽信息测试——通过在合理诱饵中呈现真实细节并测量识别者对熟知项的更强反应来识别隐匿知识。我们的方法内部识别探针(PIR)在模型内部做同样的事:呈现问题及其候选答案,从模型内部状态读取模型将哪个候选识别为正确。PIR无需参考,既不需要诚实的参考模型,也不需要标注真值语料。在来自五个家族(Gemma、Qwen、Llama、Mistral、Phi)的八个模型上,PIR以0.70至0.87的平衡准确率恢复被识别的答案,远高于0.28至0.40的未知项基线与0.25的随机水平。在我们测试的所有隐藏形式下——从提示诱导欺骗、训练性sandbagging,到外部密码锁定与电路断路的检查点——识别率保持在0.85至0.93。当模型隐藏已知答案时,识别率保持高位;当unlearning移除了知识时,识别率降至模型从未知晓问题的水平。因此,PIR能区分不愿回答与不能回答的模型,支持sandbagging审计与unlearning验证。该信号是因果性的,能提供超越黑盒行为线索的信息,并可从多选题扩展到自由生成。

语言模型的测谎试验:读取模型不愿透露的知识:论文配图
图 1:PIR 流程。我们读取每个选项的末 token 片段,将其投影到条目对比方向上,并以得分最高的选项作为识别出的答案。分歧检测器将该答案与模型的输出进行比较。