论文
ERPBench:在竞争性市场生态中评估企业决策智能体
ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies
摘要
大语言模型(LLM)智能体正被用于企业工作流,但现有评估很少测试商业决策结论是否能跨竞争性市场生态转移。我们提出了ERPBench,一个带有执行监控的基准,用于在包含定价、生产、采购、库存、财务及共享市场竞争的六轮企业资源规划(ERP)模拟中评估企业决策智能体。ERPBench在两种匹配的竞争市场生态中测试相同的100个固定问题:Solo生态中,每个评估的LLM智能体与固定规则对手对战;Arena生态中,六个评估的LLM智能体在共享市场中竞争。在六个模型家族中,共产生1,200个模型级轨迹,覆盖7,200个决策回合。在观察到的服务配置下,领先模型在不同生态中不同:DeepSeek在Solo中领先(平均估值252.29M;平均排名1.67),而Gemini在Arena中领先(263.95M;1.76)。两种生态中仅在21个问题上识别出相同任务级胜者,且Gemini的最低排名率从22%降至0%。ERPBench支持对智能体排名是否能跨市场生态转移的配对评估,并辅以整体执行干预分析。代码和基准资源可访问我们的此 https URL。
