论文
可训练性:推理模型遵循置信度信号,却不跟踪自身能力
Nudgeability: Reasoning Models Follow Confidence Signals Without Tracking Their Own Competence
摘要
可以调用工具的推理语言模型必须在推理过程中决定是独立回答还是委托回答。任何自我反思机制都必须回答三个问题:反射信号来自哪里(口头报告、输出分布、隐藏状态、单独的预测器)、如何将其呈现给模型(数值预测、置信词元、提示注入)以及它是否会改变模型的后续操作。我们孤立第三个问题。在其他相同的推理轨迹中的固定点,我们插入一个第一人称句子来表达信心或怀疑;然后模型继续推理并选择是直接回答还是调用工具。比较这些反事实的延续可以衡量反射信号对授权的因果影响。我们将这种行为反应称为可调整性(Nudgeability),并从两个维度来衡量它:敏感性,信心和怀疑改变授权率的程度;目标,是否针对模型无法独立解决的问题增加授权,针对模型可以独立解决的问题减少授权。在来自三个系列(Qwen、Gemma 和 GLM)和两项任务的 9 个中小型开放权重推理模型中,模型始终敏感:怀疑会增加委托,而信心则会减少委托,信心与怀疑之间的中位数波动为 20.6 个百分点,对于较大的提供者服务的模型为 53 至 70 个百分点。这种响应性的针对性较差:中值 42% 的诱发翻转具有良好的针对性,仅比随机选择基线高出 +2 个百分点。因此,信任语言是授权的强大控制面,但当前模型仅根据其实际能力较弱地使用它。随着内源性自我反思机制的成熟,可微移性提供了一种简单的、无需后训练的方法来评估敏感性和目标。