论文

通过导师-学生多智能体交互增强LLM问题求解

Enhancing LLM Problem Solving via Tutor-Student Multi-Agent Interaction

智能体系统Agent 协作

摘要

人类认知的发展不仅由个体努力塑造,也由结构化的社会互动塑造,其中诸如导师与学习者之间基于角色的交流,能够促成任何一方都无法独立实现的解决方案。受这些发展原理启发,我们提出这样一个问题:导师-学生多智能体系统能否通过将大语言模型(Large Language Model, LLM)推越其在现有框架内所能达到的水平,从而产生协同效应。为检验这一想法,我们采用自主编程问题领域,其中由同一LLM实例化的两个智能体被赋予非对称角色:学生智能体生成并迭代改进解决方案,而导师智能体在不接触真实答案的情况下提供结构化的评价性反馈。在我们提出的框架(PETITE)中,我们旨在通过互补角色来结构化模型的交互,从而从单一模型中挖掘出更好的问题求解性能,而非依赖更强的监督模型或异构集成。我们的模型在APPS编程基准上,与Self-Consistency、Self-Refine、Multi-Agent Debate和Multi-Agent Review等最先进方法进行了对比评估。结果表明,我们的模型在消耗显著更少token的情况下取得了相近或更高的准确率。这些结果表明,基于发展原理的角色分化交互结构,为通过结构化的类同伴交互增强LLM问题求解能力提供了一种有原则且资源高效的范式。索引词:同伴辅导(Peer Tutoring)、脚手架(Scaffolding)、大语言模型(Large Language Models)、多智能体系统(Multi-Agent Systems)、代码生成(Code Generation)。

通过导师-学生多智能体交互增强LLM问题求解:论文配图
图 1:提出的 PETITE 框架和考虑的基线架构。 (a) 在 PETITE 中,学生(编码员)生成解决方案,导师(帮助者)在迭代循环中提供反馈,产生最终接受的解决方案。 (b) MARS 引入了结构化角色,包括编码器、审阅者和元审阅者代理,以执行分层评估和细化。 (c) 自我一致性对多个独立的解决方案进行采样并选择最一致的一个。 (d) Self-Refine 采用单一的LLM,迭代地生成、批评和完善自己的解决方案。 (e) 多智能体辩论(MAD)使多个智能体能够迭代地交换解决方案和反馈,直到达成共识。