论文
MADRAG:多智能体辩论与 无需训练 分析论文评分的检索增强生成
MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring
摘要
我们提出了 MADRAG,一个用于分析论文评分的 无需训练 框架,它将多智能体推理与检索增强基础相结合。与容易产生偏见和不稳定评分的标准 LLM 法官方法不同,MADRAG 将评估分解为一个互动过程:倡导者识别优势,怀疑者批评弱点,法官将他们的论点汇总为最终分数。至关重要的是,Judge 增强了与标题对齐的示例检索功能,可以通过与评分示例进行比较来进行校准。我们的结果表明,MADRAG 显着优于基于提示的基线,同时接近监督系统的性能,而无需特定任务的训练。消融研究表明,检索可以推动校准增益,而辩论则可以改善对更高级别特征的推理。我们的研究结果强调了结构化交互和外部记忆在基于 LLM 的可靠评估中的互补作用。