论文
超越最终准确性:LLM 多Agent系统中的审计通信
Beyond Final Accuracy: Auditing Communication in LLM Multi-Agent Systems
摘要
多Agent通信旨在帮助Agent从彼此的信息中受益。然而,系统性能的改进留下了一个根本性的模糊性:它们是否反映了有效的通信、有利的Agent架构,或者仅仅是额外的推理?由于通信方法通常在其设计的系统内进行评估,因此很难理清这些因素。最终的准确性进一步将纠正的错误和损坏的答案合并为一个结果,从而模糊了沟通如何改变决策。我们引入独立-沟通-修订(ICR),这是一个受控框架,可将沟通评估为独立推理后的答案修订。 ICR 修复初始推理轨迹,根据两个智能体的初始正确性测量校正和保存,并使用无消息修订控制来量化额外推理之外的收益。在四个推理基准上,我们对文本和潜在通信的审核表明,相似的总体准确性可以掩盖截然不同的修订行为。与单独传输答案相比,全面推理增加了正确性,同时减少了所有四个基准的保留,因此更丰富的消息会放大有益和有害的影响。 MedQA 和 GPQA-D 上的接收者策略比较进一步表明,结构化验证策略将每个渠道转向更大的保留和更低的校正,而其对选择性的影响因渠道和任务而异。这些发现对将通信质量视为渠道的固有属性提出了挑战。因此,ICR 将评估重点放在选择性修订上,为检查消息内容和接收者政策如何共同产生利益和危害提供了一个统一的框架。