论文
元主持人:通过元认知增强多主体辩论能力
Meta-Moderator: Empowering Multi-Agent Debate with Meta-Cognition
摘要
多智能体辩论可以通过引发不同的假设和批评来改进 大语言模型 推理,但其性能往往受到弱调节的限制。通用管道依赖于固定预算、基于协议的停止或未经训练的法官,导致多余的审议和不可靠的证据汇总。我们将适度视为一种元认知过程,监控辩论效用,控制审议并裁决最终答案,并引入元主持人,这是一个可学习的框架,可以动态调节辩论并决定何时最终确定答案。元主持人通过结果驱动的政策优化独立于辩手进行训练,使辩论监管成为一种明确的能力,而不是提示的附带效果。在五个基准测试中,Meta-Moderator 的性能优于广泛使用的决策层以及跨任务和系统配置的传输。进一步的分析表明,它更有选择性地分配辩论,并减少信息假设出现后的错误聚合。