论文
大型语言模型中策略选择的内部剖析
The Internal Anatomy of Strategic Choice in Large Language Models
摘要
大型语言模型充当战略智能体和人类选择的模型,但像战略智能体一样进行选择并不意味着像战略智能体一样进行计算。我们记录了四个开放权重模型(密集模型和混合专家模型,包括匹配的基础指令对)在 144 场严格序数 $2\times2$ 游戏中的一次性游戏的激活情况。我们遵循预先指定的激励措施,从提示、激活到选择。密集模型反映了未经调整的人类衰退与游戏复杂性的关系。在每个模型中都可以检测到激励和选择,但模型的不同之处在于激励是否达到选择、与其一致,以及在测试中,强化选择是否会改变偏好。基础模型和指令调整的 Qwen2.5 模型在基线时的选择几乎相同,但在激励是否达到选择方面有所不同。固定决策线索在内部是可区分的,但有选择地改变选择。类似的行为可以基于不同的计算;培训后可以重塑从代表激励到决策的路径,同时使行为和可解码信息基本保持不变。