论文

评估大语言模型的交互式推理:基于可执行游戏的分层基准

Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games

智能体系统Agent任务评测

摘要

我们提出了一个用于推理评估的多轮交互框架,将推理视为主动的证据获取与信念更新。在该框架中,大语言模型(LLM)仅获得任务规则,必须向隐藏环境发出有针对性的查询,随时间整合部分观测信息,并决定何时提交最终答案。除标准的成功率和交互效率外,我们还在受控上下文扰动下评估上下文鲁棒性,并通过反事实修正与必要性判断评估元认知适应能力。我们将该框架实例化为一个包含474个可执行游戏的基准,每个游戏在对应五个难度级别的五个固定配置搜索空间下进行评估,并对广泛的前沿大语言模型进行了评测。结果表明,该基准具有很强的区分度,不仅暴露了成功率上的巨大差异,也暴露了交互效率上的巨大差异。此外,我们通过实验表明,上下文扰动导致中等但一致的下降,而反事实修正与必要性判断则带来大得多的跌幅。