论文

TROVE:基于轨迹验证与编辑的自适应智能体技能编排

TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing

智能体系统Agent 规划Agent HarnessAgent Skills

摘要

在观察到决定性的运行时结果之前,智能体倾向于优化、选择或约束执行结构。然而,这种预执行承诺会造成编排瓶颈:当中间证据使待处理的延续无效时,智能体必须执行过时的步骤或广泛地重新计划,从而加剧错误、浪费计算并丢弃进度。因此,我们提出通过验证和编辑进行基于跟踪的路由编排(TROVE),它仅修改运行时证据无效的内容。离线时,TROVE 将评估的工作流程搜索痕迹提炼为原子和复合技能以及结果条件转换图,保留稳定的片段,同时公开与结果相关的决策。在网上,它将计划的路线视为临时的:在提交一项顶级技能后,控制器保留有效的延续,插入跟踪支持的本地响应,或仅替换无效的后缀。对不同 LLM 主干的代码生成、问答和数学推理基准进行的评估表明,与数据集级优化、查询级架构选择和图约束调度的现有基准相比,TROVE 提供了更强的质量效率权衡。当结果改变适当的延续时,质量增益是最大的,而提前终止可以在接近饱和的任务上产生显着的效率增益。消融进一步表明,复合技能捕获了大部分离线收益,插入可以实现局部校正,后缀替换主要提高效率。这些发现将选择性路由编辑确立为自适应智能体编排的一般原则。

TROVE:基于轨迹验证与编辑的自适应智能体技能编排:论文配图
图 1:激励 HotpotQA 示例。在审查 (2) 检测到草稿 (1) 中缺失的证据后,AFlow 仍然执行其固定格式后缀并得分为 0。我们的 TROVE 改为应用插入来添加修订 (3),然后使用替换来替换过时的后缀的停止 (4),保留有用的前缀并将得分提高到 1。