论文

更多智能体有帮助吗?LLM智能体协作的受控协议对齐评估

Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows

智能体系统Agent HarnessAgent任务评测

摘要

一旦比较系统共享相同的基准加载程序、工具访问、应答合同、使用情况统计和轨迹记录,添加更多代理是否有助于 LLM 工作流程?我们引入了 BenchAgent,这是一种评估框架,它将单代理、固定多代理 (MAS) 和不断发展的 MAS 工作流程置于一个规范化的执行和日志记录协议下。 BenchAgent 使用 GPT-4.1 跨十个推理、编码和工具使用基准评估这些底层内部工作流程,并单独报告运行时生成的工作流程的协议对齐外部 (PAE) GAIA 研究。在 SI 条件下,六个测试的 MAS 中最多有一个在基准平衡平均准确度上超过了匹配的单智能体锚点:EvoAgent 位于 Wilson 一次运行指导范围内,而其余五个落后 2.56-11.29 个点,并需要进行更昂贵的准确度成本权衡。在 PAE GAIA 快照上,Claude-Code 式运行时工作流程总体达到 66.72%,在第 3 级达到 69.23%,比最强的非 Claude 基线 Jarvis(固定 MAS)高出 20 多点。

更多智能体有帮助吗?LLM智能体协作的受控协议对齐评估:论文配图
图 1:BenchAgent 比较共享评估基底下的工作流程范例。基准实例进入相同的加载、工具访问、记账、日志记录和评估接口,而工作流层在单代理、固定 MAS、动态/演进 MAS 和外部评估运行时生成的工作流之间有所不同。在基板内部设置中,该设计将工作流程提升与基准加载、工具实施或评估标准的差异隔离开来;在 PAE 设置下,它记录了同一评估目标下一致的运行时工作流程。核心问题是工作流组织本身是否会改变准确性、成本和跟踪行为。