论文

放大并不意味着预测:思维模型中的推理行为

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

模型评测模型行为与机制分析

摘要

哪些推理行为与推理模型中的正确答案相关,面向推理的训练是否会放大这些行为?这种区别很重要,因为面向推理的训练可以使痕迹看起来更加深思熟虑,而不会放大与模型正确性最相关的行为。我们用行为提升来量化这种不匹配,行为提升是一种衡量模型推理轨迹中存在行为与不存在行为时正确性变化程度的指标。在涵盖纯文本和视觉语言推理的 15 个模型和 6 个基准中,我们使用分类法注释了 15,282 个跟踪,其核心行为是为 LLM 和 VLM 跟踪定义的。我们发现了放大提升差距的证据,其中思维模型强烈放大了自我修正、假设检验和不确定性确认,而最高提升行为是信心校准、知识调整和自我意识。置信度校准是两种模式中最强烈的正确性积极信号之一,但几乎没有被放大;不确定性确认被放大了 3--7$\times$,但与正确性的关联较弱或呈负相关。我们发现,以推理为导向的训练不会优先放大最高升力行为,从而激发过程级目标,奖励经过校准和扎根的推理,而不是仅仅奖励表面形式。