论文

MARBO:社会推理游戏中LLM Agent的关系信念锚定

MARBO: Relational Belief Grounding for LLM Agents in Social Deduction Games

模型训练偏好优化

摘要

社会演绎游戏(SDG)要求智能体通过维持关于隐藏角色和团队联盟的关系信念,在部分可观察性下进行推理。虽然最近的 LLM 智能体方法通过提示和偏好优化来改善游戏玩法,但它们通常会优化动作和游戏中的语音,而没有明确地将其建立在此类信念之上。这经常会导致策略上不一致的行为,尤其是对于紧凑型 LLM 智能体而言。我们引入多智能体关系信念优化(MARBO),这是一种基于信念的偏好优化框架,利用关系信念来指导战略决策和游戏中的语音。仅当行为得到可靠的关系信念的支持并导致战略上有利的社会结果时,MARBO 才会提供偏好反馈,从而鼓励在不确定性下进行更一致的学习。对代表性 SDG 的实验表明,MARBO 使紧凑型 LLM 智能体能够始终优于现有基线。该代码可在此 https URL 上找到。