论文

执行正确而规划依然失败:论基于LLM的多智能体系统的认知校准

When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems

智能体系统Agent 规划

摘要

即使规划中的动作被正确执行,基于LLM的多智能体系统仍可能失败,原因在于智能体在评估规划可行性时可能误判自身的知识,我们将这一现象称为规划中的认知失准(epistemic miscalibration)。与执行错误不同,认知失准在规划阶段是潜伏的,因为生成的规划可以保持自洽且可执行而无任何可观测错误;这种失准还是动态的,因为新信息可能改变可行性评估,从而掩盖过去的失准信号并使其随时间反复出现。为解决这一问题,我们提出认知规划校准智能体工作流(EPC-AW),它评估规划在不同信息条件下是否仍然得到支持,而不是直接验证可行性。EPC-AW采用基于信息一致性的规划选择(Information-consistency-based Plan Selection),挑选在各智能体间评估稳定的规划,并结合一致性引导的认知状态精化(Consistency-guided Epistemic State Refinement),利用过去的分歧来指导未来规划,从而随时间调整校准。实验表明,EPC-AW将系统级成功率平均提升9.75%。

执行正确而规划依然失败:论基于LLM的多智能体系统的认知校准:论文配图
图 1:EPC-AW 概述。 EPC-AW 由三个代理组成:规划器、执行器和诊断器,每个代理在内存中都具有异构信息。在每一轮中,基于信息一致性的计划选择都会跨代理评估候选计划,并选择那些具有稳定评估的计划,从而提供计划时间校准信号。在各轮中,一致性引导的认知状态细化汇总了一致性反馈,以指导不断变化的信息下的规划。该过程在满足停止条件时终止,之后产生最终答案。