论文

玩强化微调的社交演绎游戏大语言模型

Playing social deduction games with reinforcement fine-tuned large language models

模型训练强化学习

摘要

增强微调 (RFT) 越来越多地用于大语言模型 (LLM) 与人类和其他智能体交互的应用中。这里我们使用社交演绎游戏来研究RFT如何改变LLM的社交行为。我们让经过微调的基础LLM智能体玩需要隐藏状态推理、社交阅读和投票引导的隐藏角色游戏。我们的结果表明,LLM智能体不能通过直接优化最终输赢结果来可靠地获得社交演绎能力,这表明最终游戏结果为社交互动学习提供了稀疏且嘈杂的信号。然而,RFT 在提高社交阅读方面特别有效,包括需要智能体从公众讨论中推断隐藏角色、随着时间的推移更新信念以及预测其他智能体未来决策的任务。我们进一步表明,RFT 还可以提高社会影响力,包括需要智能体引导投票、团队批准和集体决策的任务,尽管这些收益更依赖于行为特定的奖励和结构化交互设置。最后,我们表明,通过多智能体社交认知强化微调可以进一步提高LLM玩社交演绎游戏的能力,该强化微调在同侧多智能体训练过程中结合了社交阅读和社交影响信号。这些习得的行为也得到了人类对战略能力、说服力和社会实用性更有利的评价。总之,这些结果丰富了我们对 RFT 如何改变LLM社交行为的理解,并为机器社交智能的行为学习理论迈出了一步。

玩强化微调的社交演绎游戏大语言模型的原论文方法或结果图
图 4:RFT 改进了社交演绎游戏中的隐藏状态推理。我们在受控社交阅读任务上训练智能体,并报告训练的隐藏状态预测准确性。 a,在 Avalon 中,智能体从公开的游戏成绩单中推断出每个玩家隐藏的团队阵容。 b、在狼人/黑手党中,智能体根据对话和投票证据推断出隐藏的狼集。在已完成的 Qwen、GLM 和 DeepSeek 运行中,RFT 改进了隐藏状态推理,这表明即使基于聚合结果的游戏训练有噪音,强化微调也可以增强社交阅读。