论文

廉价的谈话稳定了大语言模型代理人的战略互动

Cheap Talk Stabilizes Strategic Interaction in LLM Agents

模型评测模型行为与机制分析

摘要

大型语言模型越来越多地部署为交互代理,这使得其在重复交互中的操作策略的持久性对于可靠的多代理操作至关重要。我们研究了代理生成的、非约束性的赛前沟通(“廉价谈话”)是否以及如何在四个开放权重 7-9B 参数 LLM 中增加这种持久性。我们的实验涵盖了四种重复的两人游戏——囚徒困境、雪堆、猎鹿和和谐——激励结构从战略冲突到联盟,每种游戏都在六种背景下呈现。我们在所有四场比赛中都观察到不稳定的轨迹,尽管它们的普遍性和程度在很大程度上取决于模型和背景。在模型、游戏和环境中,廉价言论主要是稳定的,其中五个纠正的逆转集中在社交或团队框架中;效果因模型和环境的不同而有很大差异。受控的当前消息干预在 Qwen 中确定了两个可分离的输出水平通道:减少行动不确定性和减少行动概率的轮间漂移。匹配的历史消息反事实进一步表明,最近的合作伙伴行为决定了互利与自我优先的语言如何影响政策的持久性。最后,在囚徒困境中,我们在 Qwen 和 Falcon 中确定了后期Transformer层中历史平衡的政策内容方向;投射出这个方向会增加闭环游戏期间实现的切换,这表明完整的轨迹对该组件具有因果敏感性。总之,这些发现表明,廉价的谈话可以使个人轨迹在不同的激励结构中更加持久,同时揭示稳定的程度和机制取决于模型和历史。