论文

Cattle Trade:评估LLM虚张声势、竞价与议价的多智能体基准

Cattle Trade: A Multi-Agent Benchmark for LLM Bluffing, Bidding, and Bargaining

智能体系统Agent任务评测长程任务评测

摘要

我们提出Cattle Trade,一个多智能体基准,用于评估大语言模型(LLM)作为智能体在不完全信息、对抗性交互和资源约束下的策略推理能力。该基准将拍卖、隐藏报价的交易挑战(TC)、议价、虚张声势、对手建模和资源分配组合在一场持续50–60回合的单个长程博弈中。与以往孤立测试这些能力的智能体基准不同,Cattle Trade评估智能体能否在一个激励冲突的竞争性多智能体经济博弈中综合运用它们。该基准记录每一次出价、TC报价、还价和卡牌选择,使行为分析超越最终得分或胜率。我们在242局对局中评估了七个高性价比语言模型和三个确定性代码智能体。策略连贯性——尤其是支出效率、资源纪律与随阶段自适应的竞价——与排名的关联强于支出规模或任何单一子技能。两个启发式代码智能体的表现超过多数受测LLM,行为轨迹暴露出LLM反复出现的失败模式,包括过度出价、自己跟自己竞价、在破产状态下发起TC以及对对手状态适应不足。评估智能体能力需要这样的基准:在激励冲突、不确定性和经济动态并存的多元智能体环境中测试多种能力的联合运用。

Cattle Trade:评估LLM虚张声势、竞价与议价的多智能体基准:论文配图
图 4:引擎级指标(98 个规范游戏、7 个LLM + 3 个代码代理):拍卖参与、获胜率、超额支付/出价过高频率、TC 计数器和挑战者/目标获胜率、虚张声势、平局频率、token使用、截断和每个四重奏的成本。