论文
ZebraArena:研究工具增强LLM推理—行动耦合的诊断性仿真环境
ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs
摘要
工具增强大语言模型(LLM)必须将多步推理与外部行动紧密耦合,而现有基准常使这种交互与复杂环境动态、记忆知识或数据集污染混杂在一起。本文引入 ZebraArena,一个程序化生成的诊断环境,用于研究工具增强 LLM 中的推理—行动耦合,具有可控难度与知识最小化设计,限制来自记忆或数据集污染的收益。ZebraArena 中每个任务都需要一组只能通过定向工具使用获得的关键信息,从而在外部信息获取与演绎推理之间形成可解释的接口。该设计通过唯一解提供确定性评估,并提供用于衡量高效工具使用的理论最优查询次数。我们表明,ZebraArena 需要深度推理与精准外部工具调用的结合,这仍然是一个挑战,因为 GPT-5 与 Gemini 2.5 Pro 等前沿推理模型在困难实例上仅达到60%的准确率。我们还观察到理论最优与实际工具使用之间持续存在的差距。例如,GPT-5 使用的工具调用比理论最优多70-270%。我们强调评估中的关键发现,并希望 ZebraArena 激发对内部推理与外部行动之间交互的进一步研究。
