论文
努力是上限,而不是刻度:推理预算不会调节人类与大型推理模型之间的认知成本协调
Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models
摘要
大型推理模型(LRM)生成思想链轨迹,其长度跟踪人类在认知任务中的反应时间,但最近的争论质疑这种对齐是否反映了真正的计算结构或表面冗长。我们测试对齐是否随推理时间的推理工作而变化。在 GPT-OSS-20B 和 GPT-OSS-120B 中,三个努力级别和六个推理任务、任务内和跨任务对齐保持不变:贝叶斯因子倾向于零,并且平均对齐在不同条件下的数值上几乎相同。操纵检查表明,工作量参数设置了生成预算上限,而不是驱动实时分配,这表明分配策略在训练时具体化。算术复杂性对比进一步表明,词元分配跟踪细粒度、格式相关的人类难度模式,模型规模改善了匹配。 LRM 和人类之间的认知成本一致性似乎是训练时的成就,对推理时间扰动具有鲁棒性,支持 LRM 问题解决的编译帐户而不是在线帐户。