论文

ChromaFlow:工具增强智能体评估中编排开销的负面消融研究

ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation

智能体系统Agent HarnessAgent任务评测

摘要

自主语言模型代理越来越多地结合规划、工具使用、文档处理、浏览、代码执行和验证循环。这些功能使代理系统更加有用,但它们也引入了仅从最终精度无法看出的操作故障模式。本报告介绍了 ChromaFlow,这是一个工具增强的自主推理框架,围绕规划器指导的执行、专门的工具使用和遥测驱动的评估而构建。我们在干净的评估约束下分析 GAIA 2023 1 级验证任务上的 ChromaFlow。冻结的完整 1 级基线获得了 29/53 的正确答案,即 54.72%。具有扩展编排功能的后续恢复配置实现了 27/53 的正确答案,即 50.94%,同时增加了回溯、超时事件、工具故障提及、token行调用和活动日志成本估算。两项随机 20 任务烟雾评估产生了 12/20 和 11/20 的正确答案,表明较小的诊断收益在样本中可能不稳定。因此,核心结果是负面消融:更积极的编排并没有提高全套性能,反而增加了操作噪音。该报告认为,有界规划器升级、确定性提取、证据协调和显式运行门应被视为可靠的自主代理评估的一阶要求。