论文
玩强化微调的社交演绎游戏大语言模型
Playing social deduction games with reinforcement fine-tuned large language models
摘要
增强微调 (RFT) 越来越多地用于大语言模型 (LLM) 与人类和其他智能体交互的应用中。这里我们使用社交演绎游戏来研究RFT如何改变LLM的社交行为。我们让经过微调的基础LLM智能体玩需要隐藏状态推理、社交阅读和投票引导的隐藏角色游戏。我们的结果表明,LLM智能体不能通过直接优化最终输赢结果来可靠地获得社交演绎能力,这表明最终游戏结果为社交互动学习提供了稀疏且嘈杂的信号。然而,RFT 在提高社交阅读方面特别有效,包括需要智能体从公众讨论中推断隐藏角色、随着时间的推移更新信念以及预测其他智能体未来决策的任务。我们进一步表明,RFT 还可以提高社会影响力,包括需要智能体引导投票、团队批准和集体决策的任务,尽管这些收益更依赖于行为特定的奖励和结构化交互设置。最后,我们表明,通过多智能体社交认知强化微调可以进一步提高LLM玩社交演绎游戏的能力,该强化微调在同侧多智能体训练过程中结合了社交阅读和社交影响信号。这些习得的行为也得到了人类对战略能力、说服力和社会实用性更有利的评价。总之,这些结果丰富了我们对 RFT 如何改变LLM社交行为的理解,并为机器社交智能的行为学习理论迈出了一步。
