论文

ZebraArena:研究工具增强LLM推理—行动耦合的诊断性仿真环境

ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

智能体系统Agent任务评测

摘要

工具增强大语言模型(LLM)必须将多步推理与外部行动紧密耦合,而现有基准常使这种交互与复杂环境动态、记忆知识或数据集污染混杂在一起。本文引入 ZebraArena,一个程序化生成的诊断环境,用于研究工具增强 LLM 中的推理—行动耦合,具有可控难度与知识最小化设计,限制来自记忆或数据集污染的收益。ZebraArena 中每个任务都需要一组只能通过定向工具使用获得的关键信息,从而在外部信息获取与演绎推理之间形成可解释的接口。该设计通过唯一解提供确定性评估,并提供用于衡量高效工具使用的理论最优查询次数。我们表明,ZebraArena 需要深度推理与精准外部工具调用的结合,这仍然是一个挑战,因为 GPT-5 与 Gemini 2.5 Pro 等前沿推理模型在困难实例上仅达到60%的准确率。我们还观察到理论最优与实际工具使用之间持续存在的差距。例如,GPT-5 使用的工具调用比理论最优多70-270%。我们强调评估中的关键发现,并希望 ZebraArena 激发对内部推理与外部行动之间交互的进一步研究。

ZebraArena:研究工具增强LLM推理—行动耦合的诊断性仿真环境:论文配图
图 1:此 ZebraArena 示例有 3 个房屋 (N=3)(N=3)、3 个属性 (M=3)(M=3) 和 5 条线索 (K=5)(K=5),其中一条作为缺失线索而保留。背景定义属性和唯一性约束,给定线索提供可见约束。代理通过推理给定的线索来解决难题,并在需要时查询工具箱以从环境中检索丢失的信息。最终分配显示在解决方案网格中。