论文
本地编辑,全球涟漪:工作流综合的重播通知策略适应
Local Edits, Global Ripples: Replay-Informed Policy Adaptation for Workflow Synthesis
摘要
提示策略编辑提供了一种实用的方法来改进代理,无需更新底层模型即可合成可执行工作流。然而,持久提示编辑有两个耦合属性。首先,编辑局部性并不意味着影响局部性:仅限于一个策略段的编辑可能会波及下游执行,从而改变编辑段之外的行为。其次,编辑效果对构图敏感:单独进行的编辑可能会在构图后产生干扰,导致其中之一或两者失去其益处或变得有害。因此,持久适应必须支持两个不同的决策:根据执行反馈确定策略应更改的位置,并确定生成的编辑在组合后是否仍然可以安全地保留。为了应对这些挑战,我们引入了 RIPPLE(重播通知的持久策略本地化和编辑),它将编辑的位置与合成后是否保持安全分开。它诊断失败的轨迹,将每个可操作的失败映射到预定义的策略段,并将纠正限制在策略的该部分。然后,RIPPLE 根据相同的迭代开始策略评估候选者,以比较其孤立的收益,然后在先前接受的更新后重播有希望的编辑,以暴露下游影响和交互。仅保留在合成下保持安全的编辑。我们在 Flow-HO 上评估 RIPPLE,Flow-HO 是可执行工作流程综合的综合测试基准。 RIPPLE 将验证成功率提高了 23.1%,并在两个额外的冻结语言模型主干上产生了积极的收益,同时保持了编辑效率和低执行成本。有针对性的交互分析进一步证明了这两个属性:分段本地工具使用编辑会改变下游资源解析和验证,而单独有益的编辑在组合后会变得有害。