论文

TraceCompiler:技能引导的 LLM 代理跟踪挖掘和编译为大部分确定性工作流程

TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows

智能体系统Agent Harness

摘要

使用工具的语言模型代理反复重新发现他们已经执行的过程,产生将可重用结构与重试、探索、意外排序和重复查找混合在一起的痕迹。我们提出了 TraceCompiler,这是一个技能引导的系统,可以挖掘嘈杂的代理跟踪集群并将它们编译成可执行的、大部分是确定性的工作流程。仅当消费者参数包含唯一归属于早期生产者的值时,它才承认工具间依赖性;每个硬边都带有一个可审计的证据元组,模糊的关系被标记为可疑,并且不施加排序约束。绑定分为常量、用户输入、复制输出、转换或剩余 LLM 决策。在 T1 上,该规则的机械化形式在其训练分割的 15,775 个废弃边缘上以 0.928 的精度和 0.943 的召回率恢复生产者-消费者依赖性,而邻接的 F1 为 0.711,对于相同数据的频率阈值直接跟踪测量为 0.712;在其中 250 个边缘上,盲运行的编译器技能达到 0.992。在 AppWorld 上,我们在确定性模拟器中重放已发布的轨迹,以恢复屏蔽的返回值,并以 0.993 的精度测量针对 563 个词元边缘的规则 - 这是一种自我一致性检查,因为重放通过相关启发式注入词元。我们编译了两个重复意图:Venmo 金钱请求意图将 34 个观察到的 API 调用减少到 11 个运行时调用,并且在针对基准自己的状态测试的留一执行下,通过了 21 个中的 15 个,失败的折叠升级而不是执行,因为从未观察到其所需的分支; Spotify/Todoist 意图编译器正确地拒绝编译,因为不可逆的副作用尚未确定。我们测量调用减少,但没有测量离线编译成本,因此我们没有声称净效率结果。