论文
EnterpriseBench:LLMAgent企业级战略推理和决策的基准测试
EnterpriseBench: Benchmarking LLM Agents on Enterprise-Level Strategic Reasoning and Decision-Making
摘要
人们越来越期望大语言模型Agent能够支持企业工作流程,其中的任务通常涉及缺失信息、不确定性、反馈和长期权衡。然而,现有的企业和财务基准测试主要测试信息提取、数值计算、领域知识和财务质量保证等静态能力,而对交互式和长期决策的探索还不够。为了弥补这一差距,我们引入了 EnterpriseBench,这是一个评估 LLM Agent从静态问题回答到动态决策等各个领域的基准。具体来说,EnterpriseBench将现有的企业和财务QA数据集重组为统一的基础套件,并标注能力和难度,并引入三种专业的交互设置:咨询,基于管理咨询式的业务案例,通过多轮信息查找来诊断客户问题;啤酒游戏,改编自经典的供应链管理模拟,用于延迟反馈下的库存控制;企业数字孪生(Enterprise Digital Twin)是一个基于项目的业务模拟器,用于劳动力、风险和项目规划。四种骨干模型下的九种Agent方法的实验表明,当前Agent尚未在企业场景中实现稳定、全面、跨任务的可靠性。这些结果表明,EnterpriseBench 为在现实企业战略推理和决策中评估 LLM Agent提供了实用的基准。