论文
Business Arena:在真实市场环境中基准测试大语言模型商业智能体
Business Arena: Benchmarking LLM Agents in a Realistic Marketplace
摘要
经营生意是一种具有挑战性的智能工作。经营者必须从局部信号中推断机会,在不确定下投入资本,适应变化市场中延迟显现的结果,并在合法交易前满足监管义务。前沿大语言模型智能体越来越能完成复杂工作流,但商业相关能力在现有智能体基准中很少被评估。我们提出Business Arena,一个受控环境,AI智能体在其中长期经营一家跨境商店,向供应商采购并向买家销售。该竞技场基于真实的Alibaba.com采购数据和由权威来源校准的市场条件。延迟且相互耦合的后果使单个商业决策难以评判,但其综合结果可通过利润衡量。由于仅凭利润无法解释智能体成败的原因,我们将智能体与人类设计的策略比较以估计可获得的机会,用技能级指标揭示潜在优劣,并把已实现的盈亏追溯到产生它们的行动。我们用机制消融证明,强劲结果反映真实的商业智能,而非疏忽或模拟器特有的捷径。我们评估15个前沿模型,发现平均最终净资产相差九倍。即使是最好的模型也落后于人类设计的策略,表明商业经营对大语言模型智能体仍具挑战性。技能级分析揭示了经营风格,从关注利润率的高端卖家到高周转批发商和客户服务专长型,而行动级归因找出了创造或摧毁价值的采购、定价与挽回决策。总体而言,Business Arena为评估端到端商业智能体迈出了打造现实且可信测试床的第一步。
