论文
更多风险:回报和语言如何塑造大语言模型智能体在合作困境中的策略
More at Stake: How Payoff and Language Shape LLM Agent Strategies in Cooperation Dilemmas
摘要
随着大语言模型越来越多地在交互式和多主体环境中充当自主主体,了解他们的战略行为对于安全、协调和人工智能驱动的社会和经济系统至关重要。我们研究了回报大小和语言环境如何在重复的社会困境中塑造大语言模型策略,使用回报规模的囚徒困境来隔离对激励强度的敏感性。在模型和语言中,我们观察到一致的行为模式,包括激励敏感的条件策略和跨语言分歧。为了解释这些动态,我们根据规范的重复游戏策略训练监督分类器,并将其应用于大语言模型决策,揭示系统的、模型和语言依赖的行为意图,语言框架有时匹配或超过建筑效果。我们的结果为审计作为战略代理的大语言模型提供了一个统一的框架,并强调了对人工智能治理和多代理系统设计有直接影响的合作偏见。
