论文
均衡残差揭示了语言模型中矩阵博弈策略推理的三种机制
Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models
摘要
大语言模型 可以在指定的博弈论基准上得分很高,但一旦语义线索被删除,在相同的策略计算上就会失败。我们通过程序生成的零和矩阵游戏来展示这一差距:识别熟悉游戏的模型在匿名 $2{\times}2$、$3{\times}3$ 和 $5{\times}5$ 支付矩阵上的成功率分别下降到 34%、18% 和 2%。该基准测试将语义召回、学习的近似纳什计算和限制规模的输出接口瓶颈分开。仅在 $2{\times}2$ 和 $3{\times}3$ 游戏上进行训练,监督 微调 将看不见的 $5{\times}5$--$7{\times}7$ 成功率从 2% 提高到 61%,而可利用性奖励训练平均为 37%,种子方差较高。我们证明,与不连续顶点返回 LP 均衡选择器不同,在支付扰动中,可利用性残差为 $2$-Lipschitz,这解释了为什么残差训练可以在支付转移下转移,即使格式不稳定性限制了平均性能。主导动作填充实验提供了因果证据:经过训练的模型可以解决嵌入在更大矩阵中的 3{\times}3$ 游戏,而随机填充控件会失败,密集的 12{\times}12$ 游戏仍接近失败。因此,程序评估对于衡量战略推理是必要的,而剩余奖励则揭示了一条真实但格式有限的近似均衡计算途径。