论文

MeshHeal:去中心化LLM Agent网络中灰故障的双时间尺度自愈

MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks

智能体系统Agent 协作

摘要

去中心化的基于LLM的多Agent系统通过本地交互进行协调,但一个Agent可能在保持响应的同时,其任务求解质量持续退化。这类灰故障要求在尚无足够证据改变未来路由之前保护当前任务,同时仍允许恢复的Agent重新加入。我们提出MeshHeal,一个完全去中心化的自愈框架,跨两个时间尺度耦合能力匹配的同行评审。在快时间尺度上,自适应层级将重复单评审员评估中不确定或低分的输出升级为委员会审议,并在需要时在使用前进行纠正。在慢时间尺度上,任务与能力条件化的同行相对检测器聚合分数,以区分持续性退化与普通输出波动,触发强制委员会评审,并最终将退化Agent排除出普通路由;恢复探针为重新加入提供新鲜证据。为忠实评估路由,我们引入Model-Backed MAS Evaluation,将能力分配绑定到执行模型,因为仅基于提示的能力分配会让路由错误被隐藏。在BBH、MATH与MMLU-Pro上,MeshHeal以每任务51k总模型token实现0.839的退化期准确率,而最强基线Symphony以每任务115k token仅达0.807。在交错退化与恢复下,MeshHeal隔离退化Agent,使其在恢复前不参与普通任务执行,并让其回到正常路由。

MeshHeal:去中心化LLM Agent网络中灰故障的双时间尺度自愈:论文配图
图 1:MeshHeal 概览。(a) 智能体路由并完成互补的工作。(b) 由具备相关能力的智能体进行审查,决定保留还是替换当前输出;跨任务累计的分数更新路由资格,探针机制则允许恢复的智能体重新加入。(c) 模型支持的 MAS 评估将执行模型与所声明的能力以及智能体的健康或降级状态绑定,使路由错误会反映到准确率上。