论文
大语言模型的推理能力:来自通用博弈的经验教训
Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing
摘要
本文从新视角考察大语言模型(LLM)的推理能力,聚焦其在形式化规定、规则治理环境中运作的能力。我们在一套前向模拟任务上评估四个LLM(Gemini 2.5 Pro与Flash变体、Llama 3.3 70B与GPT-OSS 120B),任务包括下一状态/多步状态推演与合法动作生成,问题集经由通用博弈(GGP)博弈实例呈现。除报告实例级表现外,我们基于40个结构特征刻画博弈,并分析这些特征与LLM表现的关联。此外,我们考察多种博弈混淆化的效应,以评估语言语义在博弈定义中的作用以及LLM训练中可能接触过特定博弈的影响。主要结果表明,受评模型中有三个在多数实验设置下表现良好,但随着评估视界增大(即博弈步数增多)出现性能下降。基于案例的详细分析为所考察的基于逻辑的问题表述中常见推理错误提供了新洞见,包括幻觉规则、冗余状态事实或句法错误。总体而言,论文报告了当代模型形式推理能力的明显进步。