论文

GRADE:LLM 代理依赖性和执行的图形表示

GRADE: Graph Representation of LLM Agent Dependency and Execution

AI 基础设施可观测性

摘要

跟踪记录了 LLM 代理在每个步骤中执行的操作。如果同时记录每一步所依赖的内容,会得到什么? GRADE 将一次运行表示为一个类型图:执行边不受跟踪影响,并提供依赖边,每个分级都是观察、声明或推断的。在跨越工具使用、编码和网络的六个观察依赖关系语料库中,我们在固定逻辑探针下根据运行大小对依赖层进行定价。在语料库中,该层在三个语料库上添加了故障预测信号,尽管一个增量在任务分组折叠下消失,另一个增量在三次样条下反转。在留一语料库转移中,大小归一化的依赖块在每个保留的语料库上保持高于机会,而在两个语料库上运行大小反转。该模式属于探针:在三次样条下,同一块在六个中的四个上都低于概率。然后,预注册的控件将节点集、步骤顺序和边计数固定下来,并且仅改变每个依赖边所附加到的较早步骤。在语料库中,它将恢复的作业与无语料库上的程度匹配的伪造作业区分开来,六个语料库的平均差异为 -0.0003。在转移中,在尺寸加依赖性臂上得分,只有 SWE-Gym 在六语料库附件屏幕中清除了 Holm。 SWE-Gym、tau-bench 和 web clear Holm 在单独的六语料库配对任务引导程序中。伪造品在两个语料库上得分更高。相反,保留每个目标的整个任务系列不会在五个目标中留下任何附件屏幕幸存者,并将 SWE-Gym 的对比度变为负值 -0.036。重用协议:对每个边缘进行分级,保持运行大小基线,并在计入结构之前对匹配的附件控制进行评分。