论文
Market-Bench:以经济与贸易竞争评测大语言模型
Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
摘要
大语言模型(LLM)管理和获取经济资源的能力尚不清楚。在本文中,我们提出Market-Bench,一个通过经济与贸易竞争来评估LLM在相关经济任务上能力的综合基准。具体而言,我们构建了一个可配置的多智能体供应链经济模型,其中LLM扮演零售商智能体,负责采购和零售商品。在采购阶段,LLM在预算约束的拍卖中竞拍有限库存。在零售阶段,LLM设定零售价格、生成营销口号,并通过基于角色的注意力机制将其提供给买家以促成购买。Market-Bench记录竞价、定价、口号、销售和资产负债表状态的完整轨迹,支持用经济、运营与语义指标进行自动评估。对20个开源与闭源LLM智能体的基准测试揭示了显著的性能差距和赢者通吃现象,即只有一小部分LLM零售商能持续实现资本增值,而尽管语义匹配得分相近,许多其他模型却在盈亏平衡点附近徘徊。Market-Bench为研究LLM如何在竞争性市场中互动提供了一个可复现的试验平台。
