论文

GAIA上的脚手架效应:受控比较

Scaffold Effects on GAIA: A Controlled Comparison

智能体系统Agent HarnessAgent任务评测

摘要

已发布的代理能力分数将模型可以做什么与其支架让它做什么混为一谈,并且在受控条件下这种启发差距的大小并没有得到很好的表征。本研究对来自三个提供商(Claude Opus 4.7、Sonnet 4.6、Haiku 4.5;Gemini 3.1 Pro Preview;GPT-5.5)的五个模型的三个支架(ReAct、Planner-Actor-Rater 多智能体设计和 planner-then-executor)在 GAIA 验证级别 1 和 2 上进行预先注册的对照比较,固定任务和条件,每个问题尝试 3 次。仅支架选择就可以在单个模型(Opus、2 级、稳健切片)中将测量精度提高多达 28 个百分点,证实了预先注册的假设,即支架变化会产生至少 10 个百分点的差距。预先注册的预测,即能力更强的模型对脚手架的敏感度较低,但在方向上被拒绝了:脚手架效应因每个数据集切片中的模型而异,但最有能力的人择模型从较难级别的结构化脚手架中获得最大收益,并且层缩放仅在稳健切片下的第 1 级有效。多智能体在 2 级上相对于 ReAct 的优势出现在 Anthropic 系列中,但不适用于跨提供商模型,这使得模型系列而不是能力分层成为调节变量,并且文件读取任务上预测的规划器-执行器优势被伪造。结构化脚手架进行的工具调用较少,但在较难的级别上更频繁地从中间轨迹错误中恢复,并且单个单元(具有规划器然后执行器的 Gemini)在两个级别上都是最便宜的,并且在第 2 级上是最准确的。这些结果表明,单脚手架能力数字是脚手架条件估计,并且不能保证随着模型的改进,启发差距会缩小。

GAIA上的脚手架效应:受控比较:论文配图
图 1:每个(模型、级别)的支架间隙(三个支架的最大减去最小精度),具有 95% bootstrap CI,显示了主要切片、稳健切片和交叉切片。虚线将人择阶梯与跨提供商模型分开。