论文
ArbiGraph:评估上下文管理的任意可扩展可验证任务图
ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
摘要
我们提出ARBIGRAPH,一个基准生成器:评估工具辅助的语言智能体能否在扩展推理工作流中保留、更新、组合与丢弃任务相关上下文。ARBIGRAPH把每个任务表示为带可执行Python求解器的自然语言问题,并经类型化中间状态组合任务——此处实例化为标量与列表值。该设计使任务图可控:长度、依赖结构、干扰项数量与值类型可变,同时保持精确的自动验证。我们以数学、GSM式应用题与Python追踪任务类别实例化ARBIGRAPH,并在四种拓扑上评估Qwen3.5-27B工具辅助智能体。结果显示:孤立任务上高准确率,但更复杂的依赖任务上实质退化——在依赖数学任务的分支链上准确率最多下降33.3%。这表明ARBIGRAPH暴露了单任务评估无法可见的失败。代码、生成数据集与评估结果见https://github.com/pavelgolikov/ArbiGraph.git。
