论文
想得更多仍得出同样答案:推理预算与大模型认知偏差
The Long Road to the Same Answer: Cognitive Bias Under Escalating Reasoning Budgets in Large Language Models
摘要
推理模型在推理时分配额外的计算,并将其答案作为深思熟虑的产物。如果这种深思熟虑按照人类认知的双过程解释所暗示的方式进行,那么更长的思考应该会削弱快速、直觉判断所产生的经典决策偏差。我们使用涵盖已建立基准的六种偏见(锚定、框架、损失规避、承诺升级、可用性、确认)的 30 个小插图,在四个模型系列中进行剂量反应研究,将每个推理模型与匹配的非推理兄弟配对,并要求思维上限为 0、1,024、4,096 和 8,192 个Token,进行 12,350 个 API 调用。因为请求的上限与实现的深思熟虑不同,所以我们使用每次调用消耗的推理Token作为剂量。首先,推理模型的偏见并不比它们的兄弟姐妹少;每个家庭的点估计都倾向于相反的方向,但项目级别的汇总对比并不可靠(Delta = +0.031,t(29)= 1.45,p = .157)。其次,偏差的大小并不会随着实现的深思熟虑而可靠地下降 增长:没有明显的负斜率,任何移动的地方都是有符号的分数远离人类方向。第三,锚定是人类方向上的唯一偏差(d = 1.89)。其他五个模型中的四个在所有七个模型中都倾向相反的方向;每个偏见有五个项目,这种逆转对于框架而言是可靠的,对于承诺、确认和损失厌恶的升级具有方向性,但可用性不存在。在回答之前重申锚点的一行指令降低了对所有五个锚定项目的锚定,尽管没有达到显着效果,但没有任何额外的思考(p = .057)。结果反对将测试时推理视为合理性保证,也反对逐个偏差地审核部署的模型。
