论文

同样的游戏,不同的故事:大语言模型 智能体的最小保守战略稳健性基准

Same Game, Different Story: A Minimal Conservative Strategic Robustness Benchmark for Large Language Model Agents

模型评测评测方法与指标

摘要

大语言模型 代理越来越多地部署在某个操作的价值取决于其他代理的行为的环境中。这就产生了战略可靠性问题:同一个博弈可能被描述为商业谈判、友好妥协、外交交流或抽象的支付矩阵,即使激励不变,模型也可能选择不同的行动。本文介绍了 \emph{相同的游戏,不同的故事},这是战略鲁棒性的基准:在保留收益的语言变化下模型引发的动作分布的不变性。实证分析使用了 Lorè 和 Heydari 同行评审研究中特意狭隘的、经过文献校准的比较:在四种社交困境游戏中,GPT-3.5、GPT-4 和 LLaMa-2 的商业框架与朋友共享框架,每个保留的模型游戏上下文单元有 300 次初始化。保留的设计包含源研究 60 个单元中的 24 个,代表 7,200 个决策。由于文章中无法提供试验级文件,因此该分析是基于重建的已发布比率的二次校准,而不是新模型的运行。作为保守的敏感性分析,效应量值向零值衰减 30%:行动变化乘以 0.70,非稳健性(定义为 1 减去稳健性得分)乘以 0.70。在此衰减下,汇集战略稳健性为 0.783,95% 引导区间为 0.774 至 0.790;相对于商业框架,朋友共享框架将合作提高了 0.307,95% 引导区间为 0.297 至 0.316。该分析支持了一种狭隘的观点,即即使激励措施固定,社会关系框架也可以改变战略选择,而无需将分析扩展到更广泛的背景或跨基准比较。