论文

ERPBench:在竞争性市场生态中评估企业决策智能体

ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies

智能体系统Agent任务评测

摘要

大语言模型(LLM)智能体正被用于企业工作流,但现有评估很少测试商业决策结论是否能跨竞争性市场生态转移。我们提出了ERPBench,一个带有执行监控的基准,用于在包含定价、生产、采购、库存、财务及共享市场竞争的六轮企业资源规划(ERP)模拟中评估企业决策智能体。ERPBench在两种匹配的竞争市场生态中测试相同的100个固定问题:Solo生态中,每个评估的LLM智能体与固定规则对手对战;Arena生态中,六个评估的LLM智能体在共享市场中竞争。在六个模型家族中,共产生1,200个模型级轨迹,覆盖7,200个决策回合。在观察到的服务配置下,领先模型在不同生态中不同:DeepSeek在Solo中领先(平均估值252.29M;平均排名1.67),而Gemini在Arena中领先(263.95M;1.76)。两种生态中仅在21个问题上识别出相同任务级胜者,且Gemini的最低排名率从22%降至0%。ERPBench支持对智能体排名是否能跨市场生态转移的配对评估,并辅以整体执行干预分析。代码和基准资源可访问我们的此 https URL。

ERPBench:在竞争性市场生态中评估企业决策智能体:论文配图
图 1:ERPBench 概述。同样的 100 个 ERP 问题在匹配的 Solo 和 Arena 竞争市场生态下进行评估。该协议匹配问题配置和模型系列标签,同时改变对手组成;六轮决策产生最终结果和执行审计记录(如果有)。