论文
PhysMent:大语言模型物理问题推理的交互式方法
PhysMent: An Interactive Approach For LLM Reasoning In Physics Problems
摘要
大型语言模型 (LLM) 在静态科学基准上表现强劲,但人们对它们通过主动实验推理物理世界的能力仍然知之甚少。我们推出了 PhysMent,这是一个通过与 MuJoCo 物理模拟器进行迭代、工具介导交互来评估 LLM 物理推理的基准。与预先提供所有数量的静态基准不同,PhysMent 要求模型在回答之前通过施加力、查询对象状态、提前时间和修改场景几何形状来发现信息。该基准测试包括 105 个经典力学场景,分为四种难度(简单/困难和单/多)、三种场景模式(标准、对象创建、隐藏对象)和场景操作类别,并使用六维评分框架进行评估。结果表明,当前模型在定性单一概念任务上表现相当不错(准确率高达 80%),但在需要精确、多步骤实验程序的定量任务上表现明显下降:大多数模型在最难的单一概念类别上表现低于 30%,其中瓶颈在于程序(自适应多步骤工具的使用)而不是概念负载。在这七个模型中,准确率从 25% 到 67% 不等,失败的原因是过早提交答案、探索效率低下以及模拟器反馈的基础不一致,而不是概念上的差距。