论文

更多风险:回报和语言如何塑造大语言模型智能体在合作困境中的策略

More at Stake: How Payoff and Language Shape LLM Agent Strategies in Cooperation Dilemmas

模型评测模型行为与机制分析

摘要

随着大语言模型越来越多地在交互式和多主体环境中充当自主主体,了解他们的战略行为对于安全、协调和人工智能驱动的社会和经济系统至关重要。我们研究了回报大小和语言环境如何在重复的社会困境中塑造大语言模型策略,使用回报规模的囚徒困境来隔离对激励强度的敏感性。在模型和语言中,我们观察到一致的行为模式,包括激励敏感的条件策略和跨语言分歧。为了解释这些动态,我们根据规范的重复游戏策略训练监督分类器,并将其应用于大语言模型决策,揭示系统的、模型和语言依赖的行为意图,语言框架有时匹配或超过建筑效果。我们的结果为审计作为战略代理的大语言模型提供了一个统一的框架,并强调了对人工智能治理和多代理系统设计有直接影响的合作偏见。

收益缩放塑造跨语言LLM智能体的合作行为
图A3:按乘数(Multiplier)划分的行为指标。我们报告 FAIRGAME 框架 Buscemi et al. [2025b] 定义的四个标准化指标:(1) Internal Variability(IV),通过度量相同实验重复之间结果的方差来量化智能体行为的随机性;(2) Cross-Language Inconsistency(CI),度量智能体在五种受测语言间表现的 standard deviation,以指示对语言框架的敏感性;(3) Variability over Round(VR),刻画在整个 10 轮博弈期内决策与策略变化的波动性;(4) Sensitivity-to-Payoff(SP),反映针对不同激励大小的行为适应幅度。雷达图比较 Mistral Large(绿色)、Claude 3.5 Haiku(橙色)与 GPT-4o(蓝色)在三个收益规模(λ∈{0.1,1,10})下的表现。与基准收益(λ=1)相比,更高收益(λ=10)下的得分相近。在低收益(λ=0.1)下,模型呈现分化的得分。总体而言,internal variability(IV)受收益规模变化的影响最大。