论文

LLM 中评估有限理性的 k 级可区分机制

Level-k Distinguishable Mechanisms for Evaluating Bounded Rationality in LLMs

模型评测评测方法与指标

摘要

推理的策略深度对于 大语言模型 (LLM) 在有限理性环境中运行的人机交互至关重要。然而,现有的评估主要基于预训练语料库中普遍存在的规范游戏,因此很难将真正的策略推理与记忆分开。为了解决这个问题,我们形式化了战略深度推理所需的 K 级可区分性条件,并构建了一套满足该标准的新颖的游戏结构。使用这些游戏,我们从思想链词元和递归推理下的实际行动以及对手游戏数据的归纳跟踪来评估 LLM 中的战略深度。在跨越四个 LLM、四种游戏结构和十个迭代推理级别的实验中,我们发现模型模型在递归推理下保持准确的策略深度,并且每个级别的陈述推理和动作之间具有很强的内部一致性。错误是由于使用了错误数量的迭代深度推理步骤而引起的,而不是由于错误地计算了最佳响应而引起的。然而,来自对手比赛的归纳推理会急剧降低游戏的准确性,并且在不同游戏中表现不均匀,而思想链中的明确战略心智化则大大提高了整体表现。