论文

按状态路由,从跟踪中恢复:具有用于多代理时空推理的故障感知马尔可夫路由的 STAR

Route by State, Recover from Trace: STAR with Failure-Aware Markov Routing for Multi-Agent Spatiotemporal Reasoning

智能体系统Agent 协作Agent Harness

摘要

组合式时空推理往往需要系统调用多个异构专家,例如几何、时间、拓扑和轨迹智能体。一个核心问题是:当执行并非简单的成功或失败、而是以质性不同的方式失败时,这类系统应如何在专家之间路由。现有的工具增强与多智能体LLM系统通常将这一路由决策隐含在语言生成中,使恢复变得临时应变、难以解释且难以优化。本文提出STAR(Spatio-Temporal Agent Router),一个失败感知的路由框架,将智能体间控制外化为基于当前智能体、任务类型和类型化执行状态的条件转移策略。STAR的核心是一个智能体路由矩阵,它将专家指定的标称路由与从执行轨迹中学到的恢复转移结合起来。由于矩阵以不同的失败状态为条件,路由器可以对畸形输出、缺失依赖和工具-查询不匹配作出不同响应,而不是将它们笼统归并为通用的重试信号。各专家通过基于工具的提取-计算-存入协议执行,并将中间结果写入共享黑板供下游融合。结果证明,训练时保留失败轨迹能扩大路由策略在错误状态上的支撑,从而实现仅用成功数据训练无法表达的恢复转移。在三个时空基准和八个骨干LLM上,STAR优于多个基线,其中执行偏离标称路由路径的查询增益最为明显。针对路由器的消融与恢复分析进一步表明,类型化的失败感知路由、而非单纯的专家组合,是这些提升的关键因素。

按状态路由,从跟踪中恢复:具有用于多代理时空推理的故障感知马尔可夫路由的 STAR
图 1:星型架构。查询被解析为任务配置文件,故障感知路由矩阵根据当前代理、任务类型、执行状态选择专家,专家在最终融合之前通过共享黑板的提取-计算-存储协议执行。