论文

批评者引导的异构多智能体推理用于可靠数学推理

Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving

智能体系统Agent 协作

摘要

最近的大型语言模型(LLM)表现出了令人印象深刻的推理能力;但他们在复杂的数学推理问题中仍然容易出现幻觉、中间推理错误以及推理结果不可靠。在本研究中,我们引入了一种基于批评家的异构多智能体方法来提高数学推理的可靠性。该框架结合了多个不同专业的大语言模型代理,并采用评审Agent驱动的自适应学习系统来评估和指导基于中间反馈的推理过程。该系统采用生成器-验证器框架,验证器不仅确定正确性,还提供批评来指导解决方案的重新生成。这允许自适应纠错并防止错误级联。我们在 GSM8K 基准测试上的实验表明,所提出的方法比单次模型和非临界模型的精度提高了 13%。此外,研究结果表明,异质性和批评减少了对大型模型的需求,从而使较小的模型能够发挥同等作用。消融研究表明,主要的性能提升是由于基于评论家的反馈循环而不是模型大小。总之,所提出的方法展示了结合异构多智能体协作和批评以获得可靠且可解释的推理系统的好处。