论文

ArbiGraph:评估上下文管理的任意可扩展可验证任务图

ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

智能体系统上下文与知识上下文工程Agent任务评测

摘要

我们提出ARBIGRAPH,一个基准生成器:评估工具辅助的语言智能体能否在扩展推理工作流中保留、更新、组合与丢弃任务相关上下文。ARBIGRAPH把每个任务表示为带可执行Python求解器的自然语言问题,并经类型化中间状态组合任务——此处实例化为标量与列表值。该设计使任务图可控:长度、依赖结构、干扰项数量与值类型可变,同时保持精确的自动验证。我们以数学、GSM式应用题与Python追踪任务类别实例化ARBIGRAPH,并在四种拓扑上评估Qwen3.5-27B工具辅助智能体。结果显示:孤立任务上高准确率,但更复杂的依赖任务上实质退化——在依赖数学任务的分支链上准确率最多下降33.3%。这表明ARBIGRAPH暴露了单任务评估无法可见的失败。代码、生成数据集与评估结果见https://github.com/pavelgolikov/ArbiGraph.git。

ArbiGraph:评估上下文管理的任意可扩展可验证任务图:论文配图
图 1:ArbiGraph 生成器抽象和具体生成的实例。顶部:生成器将任务图与类型化可执行任务模板相结合,生成自动生成、自动验证的单提示基准实例数据集。底部:示例链提示摘录,如代理看到的那样显示。颜色标记提示角色:蓝色文本跟踪输入,橙色描述预处理适配器,绿色是特定于任务的计算,洋红色跟踪输出。