论文
更多智能体有帮助吗?LLM智能体协作的受控协议对齐评估
Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows
摘要
一旦比较系统共享相同的基准加载程序、工具访问、应答合同、使用情况统计和轨迹记录,添加更多代理是否有助于 LLM 工作流程?我们引入了 BenchAgent,这是一种评估框架,它将单代理、固定多代理 (MAS) 和不断发展的 MAS 工作流程置于一个规范化的执行和日志记录协议下。 BenchAgent 使用 GPT-4.1 跨十个推理、编码和工具使用基准评估这些底层内部工作流程,并单独报告运行时生成的工作流程的协议对齐外部 (PAE) GAIA 研究。在 SI 条件下,六个测试的 MAS 中最多有一个在基准平衡平均准确度上超过了匹配的单智能体锚点:EvoAgent 位于 Wilson 一次运行指导范围内,而其余五个落后 2.56-11.29 个点,并需要进行更昂贵的准确度成本权衡。在 PAE GAIA 快照上,Claude-Code 式运行时工作流程总体达到 66.72%,在第 3 级达到 69.23%,比最强的非 Claude 基线 Jarvis(固定 MAS)高出 20 多点。
