论文

ConSensus:面向多模态感知的多Agent协作

ConSensus: Multi-Agent Collaboration for Multimodal Sensing

智能体系统Agent 协作

摘要

大语言模型 (LLM) 越来越多地基于传感器数据来感知和推理人类生理学和物理世界。然而,准确解释异构多模态传感器数据仍然是一个基本挑战。我们表明,单一的大语言模型通常无法跨模态进行连贯的推理,从而导致不完整的解释和先验知识偏差。我们引入了 ConSensus,这是一个免训练的多智能体协作框架,它将多模态传感任务分解为专门的、模态感知的智能体。为了聚合代理级别的解释,我们提出了一种混合融合机制,该机制可以平衡语义聚合(实现跨模态推理和上下文理解)与统计共识(通过跨模态一致提供稳健性)。虽然每种方法都有互补的故障模式,但它们的组合可以在传感器噪声和丢失数据的情况下实现可靠​​的推理。我们在五个不同的多模态传感基准上评估了 ConSensus,结果表明与单代理基准相比,平均准确度提高了 7.1%。此外,ConSensus 匹配或超过了迭代多智能体辩论方法的性能,同时通过单轮混合融合协议将平均融合token成本降低了 12.7 倍,为现实世界的多模态传感任务提供了强大而高效的解决方案。

ConSensus:面向多模态感知的多Agent协作 配图
图 4:ConSensus 概览:(i) 模态智能体生成针对各传感器的专门解读;(ii) 语义融合智能体聚合跨模态推理;(iii) 统计融合智能体提供将推理锚定于多数意见的输出;(iv) 混合融合智能体调和两种输出以产生最终决策。