论文

面向复杂推理的群体协商式多智能体会话模型

Group Deliberation Oriented Multi-Agent Conversational Model for Complex Reasoning

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

本文提出一种面向群体协商的多智能体会话模型,以应对单个大语言模型在复杂推理任务中的局限。该模型采用生成、验证与整合的三层角色分工架构:观点生成智能体产生多样的推理视角,证据验证智能体检索外部知识并量化事实支持程度,一致性仲裁智能体整合出逻辑连贯的结论。模型引入自博弈机制以扩展多路径推理轨迹,同时由检索增强模块动态补充外部知识。研究设计了结合事实一致性与逻辑连贯性的复合奖励函数,并应用改进的近端策略优化策略进行协作训练。实验结果表明,该模型在 HotpotQA 上将多跳推理准确率提升 16.8%,在 2WikiMultihopQA 上提升 14.3%,在 MeetingBank 上提升 19.2%,同时将一致性提高 21.5%。该模型取得高于主流多智能体方法的推理效率,为复杂推理任务提供了有效且稳定的解决方案。