论文
ClosureBench:组合图推理的建设性基准
ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning
摘要
大语言模型 在多步骤组合推理上失败,但衡量失败很困难,因为新模型是根据用于评估它们的基准进行训练的。固定的测试集在发布后很快就会成为记忆检查。建设性基准通过按需生成实例来避免这种情况。我们引入 ClosureBench,这是图关系逻辑推理的建设性基准。每个任务都是根据显式原语(可达性、程度、集合操作、连接性、聚合)构建的,其参考答案是通过执行精确实现该逻辑的代码来计算的。 真值因此被验证,并且新鲜实例的供应是无限的。该基准测试涵盖三个组成级别的 26 个任务类别,具有三个独立的难度轴:图形大小、边缘密度和查询深度。我们评估从 1.5B 开放权重到前沿系统(o3、GPT-4.1、Gemini 2.5、Claude Sonnet 4)的模型。随着图大小和查询深度的增加,并且两个轴相互作用,准确性会下降。困难不在于表面形式,因为当图以 JSON 边列表或邻接矩阵而不是散文形式给出时,它仍然存在,也不在于正确建模状态的推理规则。它在于通过多个步骤对图表进行排除。经过微调以发出经过验证的程序而不是答案的 4B 模型在各个组成级别上几乎保持平坦,而每个前沿模型都会降级。 o3 从原子查询的 96% 下降到最组合查询的 82%; 4B模型保持93%的准确率,而词元成本仅为一小部分。该程序将多步执行卸载到运行时,模型的剩余错误几乎完全是误读的图边。建设性生成还支持直接记忆检查,比较已见过的实例和新实例的准确性。