论文

ControlScope:LLM Agent 中的工作流程修订和可靠性

ControlScope: Workflow Revision and Reliability in LLM Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

语言模型Agent应该修改多少正在运行的工作流程? ControlScope 会比较持续生成的代码,编辑下一个工具调用的数据参数,并从相同的公共执行状态替换未完成的工作流程。嵌套权限将可用修复与Agent选择的操作分开。我们评估跨文件系统任务、ALFWorld 和 AppWorld 的一次性和重复审查。每个任务有两个源程序,三个推理审查程序利用 20 个文件系统任务,FULL 完成 15-16 个任务,而 KEEP 完成 13 个任务;在四次快速抽奖中,它完成了 10-13 与 13。新的学生记录确认再现了批量读取修复。 ALFWorld 快速面板在 52 个场景的 87 项任务上的 KEEP/ARG/FULL 得分为 85/86/87,在 4 个场景的 134 项任务上的 KEEP/ARG/FULL 得分为 134/134/127;对 87 个任务组的推理也产生 85/86/87,但审查成本很高。 AppWorld V1 官方测试面板包含来自 195 个场景模板的 585 个任务实例,显示出微小的净差异。冻结的重播暴露了可行的Agent编写的替换,在两次失败的文件组织运行中被后来的修订中断。离线源轨迹中点比较显示后来的评论完成了不充分的修复。五次调用保护可节省 19.4% 的记录模型输出,并在 20 次新源运行中丢失一次成功。仅参数快捷方式表明,更广泛的采样策略可能会忽略两个操作集中可用的更便宜的成功编辑。这些结果将修复访问与实际选择和后续执行联系起来。