论文
EcoAgent-Bench:评估预算约束LLM Agent的经济决策
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents
摘要
代理基准通常测量任务完成情况,并将资源使用视为辅助统计量。然而,在部署过程中,选择本地查找、广度搜索、复合研究工具、更强模型或人类升级是任务的一部分。我们引入EcoAgent-Bench,其中每个任务都指定价格行动和明确预算。304个实际衍生的任务覆盖了GAIA、HotpotQA和MuSiQue五个家族,并测试了四个决策:避免不必要的升级、当本地证据不足时升级、选择模型层级以及在不支持前提下停止。我们在工具-API和工作区-CLI设置中评估了七个LLM代理,同时与四组oracle脚本控制一起进行评估。微平均准确度奖励单向策略:总是升级的控制能够实现高微成功,但在失败的任务中未能保存。因此,我们还报告了一个经济一致性分数(在升级导向和保底导向家族组中的准确性较差),暴露了这一失败。工具-API代理仅达到3.9-24.0%的严格微成功(最多7.3%的经济一致性),经常要么在合理的情况下停止升级,要么过度支出于廉价的任务。阈值跨越预算扫面改变了GPT-5.4的升级率从0%到只有3%。这些结果表明,在预算内完成和经济行动选择是不同的性质。我们释放了任务包、转换管道、冻结评估环境以及完整性约束的结果文件,以便研究两者。