论文

先确定答案再推理:开放权重LLM的行为复现与初步激活证据

Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM

模型评测模型行为与机制分析

摘要

聊天模型有时先确定答案,再生成支持它的推理,而不是通过推理得到答案,即使这一答案违反任务前提。论文研究一个简单问题:“我想洗车。洗车场在100米外,我应该走路还是开车?”正确选择只能是开车,因为车必须到场,但模型大多建议步行。 首先,作者在Qwen3-8B上使用五种系统提示条件,共生成210条轨迹。在思考与非思考模式下,每种条件中85%–100%的采样轨迹先确定了错误答案;贪婪解码轨迹的比例为100%。4,096词元的思考预算也未修复这一现象。其次,作者用预训练且无需任务特定训练的激活探测模型,在输出答案文本前的位置读取隐藏状态。“步行”读出比例超过中性上下文基线,分别为68%与17%;对最终选择步行和开车的轨迹,Fisher精确检验均为p=.005。最终回答开车的轨迹也有5/6在先前位置被读出为倾向步行。 探测模型对无关内容的默认读出是“开车”,比例为83%,因此读出不能简单解释为偏向步行的词汇偏差。按walk/drive字面出现情况分层后,包含drive的文本仍可能被读出为步行;在词汇平衡条件中,以每条轨迹的多数读出计,步行倾向为15/22,中性提示基线为1/8(p=.01);最终选择开车的轨迹为6/6(p=.002)。样本较小,轨迹内的位置梯度也不显著(p=.34),作者将其视为初步证据。最后,在固定探测模型、激活与位置时,仅改变问题措辞,就使阳性对照命中从开放问题的2/16变为封闭问题的11/16;若没有针对各类措辞设置阳性对照,就无法解释阴性探测结果。