论文
正确的答案,错误的状态:多智能体协作中的隐藏信息失败
Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaboration
摘要
多智能体系统通常通过是否得出正确答案来判断。这可能会错过一个明显的失败:即使即时决策是正确的,协作也可能会留下损坏的信息状态。我们称之为脱离查询失败。为了研究协作决策支持中的这种失败,我们引入了 OffQuery,它分别评估两个代表性高风险环境中的证据验证 (T1)、共享状态重建 (T2) 和任务解决 (T3):医疗保健和灾难响应。在 GPT、Gemini 和 Qwen 模型中,标准协作显示出比状态可靠性更强的任务性能。平均超过 21 种模型设置组合,任务分辨率达到 64.7%,而证据验证和状态重建仅达到 14.3% 和 43.1%。我们将这种差距追溯到选择性的信息使用:当前的查询通常会绕过损坏的事实,当后续任务需要它们时,这些事实就会产生后果。我们进一步介绍了 ReGround,它可以解决相互矛盾的证据、验证共享事实、重建可信状态并对该状态进行推理。在三个系列的七个模型中,ReGround 提高了每个评估环境中的所有三种功能,在 T1、T2 和 T3 上的平均相对增益分别为 309.0%、82.9% 和 17.6%。因此,可靠的协作需要正确的决策和用于未来推理的可靠的共享状态。