论文

从单独学习到社交学习:大语言模型中递归社交改进的特征

From Solo to Social Learning: Characterizing Recursive Social Improvement in LLMs

智能体系统Agent 协作

摘要

大语言模型 (LLM) 现在可以通过修改其遵循的指令来改进自身,并且 LLM Agent越来越多地协调起来共同解决复杂的问题。然而,自我改进方法通常一次优化一个系统,而多Agent框架通常让每个模型都朝着共同的目标努力。我们问一个不同的问题。当每个Agent都追求自己的回报时,自我完善的大语言模型能否充分相互学习以改善整个群体?我们将这种能力称为递归社会改进。我们研究修改技能文件的人群,并选择是否、何时以及向谁进行复制。独立搜索、向同行学习和行动都共享一个象征性预算。在受控环境中,已建立的社交学习算法可以从同伴中受益,但三位大语言模型却不能。他们从每个词元中获得的奖励比单独学习者要少,而且探索范围太窄,或者在行动之前就用完了词元。然后我们让模型编写和修改自己的技能。观察同行会改变他们改进的方式,帮助一个模型更快地找到有用的技能,而另一个模型则减少在私人搜索上的花费。然而,在相同的成本下,两者的表现都比不上独立学习者。技能会被复制、修改和传承,因此一项发现可以为进一步的研究奠定基础。然而,这些交流将人们集中在较少的独立发现上。总之,这些结果表明,大语言模型可以通过复制同行来提高学习效率,但还不够有效。