论文
面向剧本杀游戏不完美信息推理增强的协作式多智能体剧本生成
Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games
摘要
视觉语言模型(VLM)在感知任务中展现出令人印象深刻的能力,但在具有不完美与欺骗性信息的多人游戏设定下进行复杂多跳推理时,其性能会下降。本文研究一个具有代表性的多人任务——剧本杀游戏(Murder Mystery Games),它要求基于持有不同意图的角色所提供的部分线索来推断隐藏真相。为应对这一挑战,我们提出一个协作式多智能体框架,用于评估与合成高质量、角色驱动的多人游戏剧本,实现针对角色身份(即凶手与无辜者)定制的细粒度交互模式。我们的系统通过智能体间的协同交互,生成丰富的多模态上下文,包括角色背景故事、视觉与文本线索以及多跳推理链。我们设计了一种两阶段智能体监督训练策略来增强VLM的推理能力:(1) 在建模不确定性与欺骗性的精选及合成数据集上进行基于思维链(chain-of-thought)的微调;(2) 采用智能体监督奖励塑形的基于GRPO的强化学习,鼓励模型发展角色特定的推理行为与有效的多模态多跳推理。大量实验表明,我们的方法显著提升了VLM在叙事推理、隐藏事实提取与抗欺骗理解方面的性能。我们的贡献为在不确定、对抗性与社会复杂条件下训练和评估VLM提供了可扩展的解决方案,为未来在不完美信息下的多模态多跳推理基准奠定了基础。
