论文
APG:在多智能体辩论发布前阻断虚构共识
Towards Mitigating Fabricated Consensus: The Active Provenance Gate for Multi-Agent Debate Synthesis
摘要
基于大型语言模型的多智能体辩论(MAD)系统越来越多地用作分布式流程中的复杂决策管道。然而,它们的最终合成阶段仍然没有得到充分控制。即使有详细的辩论日志,总结模型也很容易产生流畅的辩论共识,而这些共识并非以辩论历史为基础。为了解决这一安全差距,本文提出了实证研究,并研究了引入积极的辩论后验证是否可以减少这种事实上不受支持的摘要的产生,同时仍然提供有价值的信息。此外,还检查了在缺乏可靠妥协的情况下是否更可取地明确发出分歧信号。主动出处门 (APG) 被引入作为辩论后验证层,它将来源视为硬约束,分析辩论日志,审核每个主张并应用自我纠正。在危机模拟中,在严格的门禁阻止不受支持的主张并生成分歧报告之前,自我修复机制在困难条件场景下将平均数据来源保真度提高了一倍以上。在人类研究中,绝大多数用户(超过 75%)更喜欢一份明确指出关键场景中失败的报告,尽管他们中的大多数人认为来自基线系统的捏造共识更流畅。我们的主要贡献是将数据来源追踪从被动记录转变为发布前的主动条件阻塞。