论文
Cattle Trade:评估LLM虚张声势、竞价与议价的多智能体基准
Cattle Trade: A Multi-Agent Benchmark for LLM Bluffing, Bidding, and Bargaining
摘要
我们提出Cattle Trade,一个多智能体基准,用于评估大语言模型(LLM)作为智能体在不完全信息、对抗性交互和资源约束下的策略推理能力。该基准将拍卖、隐藏报价的交易挑战(TC)、议价、虚张声势、对手建模和资源分配组合在一场持续50–60回合的单个长程博弈中。与以往孤立测试这些能力的智能体基准不同,Cattle Trade评估智能体能否在一个激励冲突的竞争性多智能体经济博弈中综合运用它们。该基准记录每一次出价、TC报价、还价和卡牌选择,使行为分析超越最终得分或胜率。我们在242局对局中评估了七个高性价比语言模型和三个确定性代码智能体。策略连贯性——尤其是支出效率、资源纪律与随阶段自适应的竞价——与排名的关联强于支出规模或任何单一子技能。两个启发式代码智能体的表现超过多数受测LLM,行为轨迹暴露出LLM反复出现的失败模式,包括过度出价、自己跟自己竞价、在破产状态下发起TC以及对对手状态适应不足。评估智能体能力需要这样的基准:在激励冲突、不确定性和经济动态并存的多元智能体环境中测试多种能力的联合运用。
