论文
LLM 中的识别-拒绝错位:为什么模型回答结构上无法回答的问题
Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions
摘要
大语言模型 经常回答结构上无法回答的问题,例如计算 cot(-540°) 或评估 (1).startswith("1"),而不是弃权。我们询问这种失败是否反映了认可缺失或从认可到弃权的路由失败。在从 1.7B 到 70B 参数的指令调整模型中,隐藏状态中的单个线性方向将可回答的数学和代码提示与结构上不可能的数学和代码提示分开,这表明模型在生成之前就代表了不可能。然而,这种识别方向几乎与规范的安全拒绝方向正交,后者介导经过训练的有害内容拒绝。域内行为定义的无效感知方向更接近识别,但仅部分与其一致,并且与安全拒绝保持接近正交。沿着识别方向的生成时间转向会在结构数学和代码单元上双向和剂量响应地改变无效感知行为,而随机方向则不会。基础/指令比较进一步表明,低余弦几何结构已经存在于预训练端点。因此,将不可能的置信失败更好地解释为路由失败而不是编码失败:模型具有可用的“不允许答案”信号,但安全拒绝路径未对齐以使用它。