论文

MARO:从社会交互中学习更强的推理

MARO: Learning Stronger Reasoning from Social Interaction

模型训练强化学习

摘要

人类在日常生活中面对无数需要推理与判断的场景。然而,现有大语言模型训练方法主要让模型从既有文本内容中学习或解决预定问题,缺乏在与他人交互、协商与竞争的真实场景中的经验。为此,本文提出多智能体奖励优化(MARO),一种让大语言模型(LLM)通过在多智能体社会环境中学习与练习来获得更强推理能力的方法。具体而言,MARO 首先通过把最终成败结果分解到交互过程中的每个具体行为来解决学习信号稀疏问题;其次,通过平衡不同角色的训练样本权重来处理角色分布不均问题;最后,通过直接评估每个行为的效用应对环境不稳定问题。实验结果表明,MARO 不仅在社会推理能力上取得显著提升,而且通过社会模拟学习获得的能力能有效迁移到数学推理与指令遵循等其他任务。这揭示了多智能体社会学习在增强 LLM 通用推理能力方面的巨大潜力。

MARO:从社会交互中学习更强的推理
图1:MARO 工作流总览。第一,智能体在社交场景中交互,每个智能体通过沟通与决策追求各自的目标。第二,交互结束后,系统评估最终结果,以判定每个参与智能体的成败。第三,MARO 将这些稀疏的最终结果分解为分布在每个智能体动作轨迹上的稠密逐步奖励,并纳入角色专属权重以实现均衡训练。第四,分解得到的奖励数据通过 MARO 专用的损失函数用于优化 LLM,以增强社会推理能力。