论文
更多辩论、相同证据:同质多Agent证据支撑能力的结构局限
More Debate, Same Evidence: Structural Limits of Homogeneous Multi-Agent Groundedness
摘要
大语言模型(LLM)判官正越来越多地组织成多代理小组,假设交换批评可以提高判官的质量。我们测试这一假设,即在“基础性验证”中,判官必须判断一个陈述是否由提供的证据支持。我们评估了一个由六组公开的实证验证和幻觉检测基准组成的同质三代理判官系统。相对于固定单代理参考,系统的相对准确度差异范围从+8.5到-4.4个百分点:两个数据集显示出可靠的改进,一个数据集显示出可靠的损失,三个数据集统计上不明显。因为参考和判官使用不同的模型变体,这些差异刻画了完整的系统,而不是隔离了因果辩论效应。