论文

多智能体交互中的表征相似性和模型行为

Representational Similarity and Model Behavior in Multi-Agent Interaction

模型评测模型行为与机制分析

摘要

研究人员表明,人类之间的神经相似性可以预测社会亲密程度和合作成功,而创新往往来自不同个体之间的互动。我们通过检查 大语言模型 之间的交互来调查这些原则是否扩展到人工智能。在我们的实验中,276 个模型对在 8 个游戏中进行交互,涵盖合作和新颖性。我们发现,具有更相似表示空间的配对可以实现显着更高的合作,但表现出新颖性和创造力降低。即使在控制了性能差异和模型大小等其他因素后,表征相似性对合作和新颖性的影响仍然强劲。我们还发现,与中间层和后面的层相比,早期层的相似性始终显示出与合作和新颖性最强的关联。这表明这些模式背后的一个核心因素可能是这两个模型共享词汇和语义基础的程度。总的来说,表征相似性是多智能体系统设计中的一个重要考虑因素。