论文

面向推理任务的智能体框架:一项实证研究

Agentic Frameworks for Reasoning Tasks: An Empirical Study

智能体系统Agent任务评测

摘要

智能体框架的最新进展使AI智能体能够执行复杂推理与决策。然而,比较其推理性能、效率与实用适配性的证据仍然有限。为填补这一空白,我们在BBH、GSM8K和ARC三个推理基准上对22个广泛使用的智能体框架进行实证评估。这些框架从2023年1月至2025年7月收集的1,200个GitHub仓库中遴选,并按架构设计组织成分类体系。我们在统一设置下评估它们,测量推理准确率、执行时间、计算成本与跨基准一致性。结果显示,22个框架中有19个完成了全部三个基准。其中12个表现稳定,平均准确率为74.6-75.9%,每任务执行时间4-6秒,成本为每任务0.14-0.18美分。较差的结果主要由编排问题而非推理能力极限导致。例如,Camel因上下文无节制增长在11天后仍未能完成BBH,而Upsonic因反复抽取失败触发昂贵的重试,一天内消耗了1,434美元。AutoGen和Mastra也因迭代交互不断增加提示长度却未改善结果而耗尽API配额。我们还发现数学推理出现大幅下滑。GSM8K上的平均准确率为44.35%,而BBH为89.80%,ARC为89.56%。总体而言,本研究提供了首个面向推理密集型软件工程任务的智能体框架大规模实证比较,并表明框架选型应优先考虑编排质量,尤其是内存控制、失败处理与成本管理。

面向推理任务的智能体框架:一项实证研究:论文配图
图1:该实证研究的总体设计与评估工作流,展示各智能体框架在推理任务上的实验组织方式。