论文

Agent 可靠性来自哪里?分解验证循环、专门模型与执行框架的贡献

Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent

智能体系统Agent任务评测

摘要

多步骤企业代理任务以一种典型的方式失败:单遍推理在决定答案和提交答案之间没有检查点。我们研究了一种生产系统(Leni),其架构安装了这样的检查点:由轻量级任务专用的训练后模型组成的验证循环(执行、观察、比较、纠正)。我们在三个强调不同故障模式的公共基准上评估未经修改的生产配置:SpreadsheetBench Verified(无声计算错误)、BullshitBench v2(前提编造)和 GAIA 验证分割(长工具链上的级联错误)。整个系统在 SpreadsheetBench 上比其前沿基础模型提高了 +11.0 个百分点(91.25% vs 80.25%,n=400,p<0.001),在 BullshitBench 上提高了 +7 到 +10 个百分点(98% vs 91%,n=100),在 GAIA 验证上大约提高了 +15 个百分点(75.2% pass@1,n=165; 83.0% 最佳 k)。我们的核心贡献是对这种提升的分解:大部分来自脚手架、路由和专业模型,而不是来自验证步骤本身,验证步骤本身的贡献很小(+1.5分),但集中在分数分布的顶部,在那里它转换了其他失败的任务。我们对循环进行端到端检测,产生一个经验验证者混淆矩阵(捕获率约为 0.20,修复率 0.75,无误报回归),该矩阵为复合可靠性模型奠定了基础。专家交换消融表明,循环的价值取决于观察者:用生成前沿模型替换经过训练的小型验证者可以使多数挽救效果消失。有效前提控制显示 100 个专家级问题的过度拒绝为零。