论文

ToolGate:构建依赖工具的科学基准的可执行验收流水线

ToolGate: An Executable Acceptance Pipeline for Tool-Dependent Scientific Benchmark Construction

模型评测基准与评测资源

摘要

科学基准通常由领域专家建立,他们编写任务并交叉检查彼此的工作,或者改编教科书、已发表论文和在线资源中的现有材料。这些路线可以产生强有力的评估,但它们需要大量的每个项目的劳动力。语言模型可以通过快速推荐候选人来减少这种重复的工作。剩下的问题是接受。我们的目标是科学问题,其答案需要使用专业软件进行计算,而不是单独进行无辅助推理。如果候选者的脚本失败或返回不同的答案,则该候选者无效;如果模型在没有软件的情况下回答它,则该候选者是微不足道的。我们提出了 ToolGate,它将每个生成的项目视为提案,并且仅在三个门通过时才保留它。首先,可执行解决方案脚本在与科学软件一起运行时必须重现建议的答案。其次,随机无工具筛选会拒绝模型已经可以仅根据提示解决的候选者。第三,使用工具的智能体必须在固定的时限内解决每个幸存者。我们在 FEniCSx 中实例化 ToolGate,进行了 500 次生成尝试。本地验证门保留了 478 名候选人。对于最终报告,我们在生成后重新筛选此池:两个随机的无工具筛选从报告的池中排除了 222 个,并在中等推理(API 默认值)下直接 GPT-5.5 API 调用排除了另外 121 个。在剩下的 135 个中,可以访问 FEniCSx 的 GPT-5.5 Codex CLI 代理解决了 130 个;精确的重复数据删除留下了 128 个独特的协议幸存者。 ToolGate 将重复的答案检查和难度筛选转变为可审核的过程,同时将领域设计和最终审核留给专家。