论文
EffectMatch:在继续执行前核对智能体的持久副作用
Beyond Approved Actions: Runtime Validation of Persistent Outcomes in Agent Workflows
摘要
大型语言模型代理越来越多地作用于软件系统,不再仅仅生成文本,而且还改变数据库和在线服务。但是,已批准的数据库更新可能会成功,但会留下未批准的通知,因为执行可能会产生超出请求的更改范围的持久影响。当前的保障措施可以批准一项操作或记录其后果,但如果在继续之前不检查持久结果,则未经批准的结果可以被接受为成功并传播到后续步骤。我们提出了 EffectMatch,一个运行时,它收集受控执行边界内的持久更改,并将它们与应用程序批准的当前状态和执行进行比较。 比较结果决定是否提交以及是否执行依赖步骤。在206个公开业务任务的对比评估中,EffectMatch保留了所有正常执行,并阻止了所有测试中的错误提交。 6 个 20 次运行的消融暴露了每个删除机制导致的失败,而 80 个任务拓扑案例保留了真实的切换并阻止了无效的继续。总之,这些结果表明,EffectMatch 阻止了与应用程序批准不一致的持久结果的静默接受和下游传播。