论文

为策略家搭建脚手架:霍特林空间市场中架构依赖的推理干预

Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets

模型评测模型能力评测

摘要

我们研究结构化推理干预能否改善大语言模型的策略性经济推理,以及其效果是否依赖模型架构。以霍特林线性城市模型为诊断载体,我们在五个条件下(无脚手架基线与四种推理干预)评估GPT-4.1-mini(标准指令模型)与GPT-5-mini(推理优化模型):八个问题横跨演绎与溯因推理、三种提示框定、每条件三次重复,共720个单独评判的响应。我们发现脚手架类型与模型架构之间存在统计显著的交叉交互(t(7)=4.79,p=0.002,d=1.69):承诺脚手架改善标准模型(+0.21)却损害推理模型(-0.63);原理分离则呈相反模式(-0.40对+0.31)。两个交叉都单独显著(承诺:p=0.040;分离:p=0.002),并在全部八题上保持7/8的方向一致性。对抗压力测试损害两个模型,推理模型退化大2.6倍(-1.47对-0.57;p=0.038),且损害与基线难度负相关(R²=0.36,p=0.014)。我们进一步记录了一个持续的“陈述—程序”鸿沟:两个模型识别正确策略的比率远超其执行能力;分离干预完全弥合推理模型的这一鸿沟,而任何干预都无助于标准模型。

为策略家搭建脚手架:霍特林空间市场中架构依赖的推理干预:论文配图
图 1:脚手架类型和模型架构之间的交叉交互。承诺(最左边的一对)有助于标准模型,但会损害推理模型;分离(第三对)显示相反的情况。误差线显示每个问题 8 个增量的 SEM。括号表示配对交互显着性:*p<.05{}^{*}p<.05; p*⁣*<.01{}^{**}p<.01。