论文

VLM的戈尔迪之结:作为高难基准的绳结图推理

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

模型评测基准与评测资源

摘要

视觉语言模型可以看着绳结图并报告所见内容,却无法对该结构进行操作。KnotBench将来自1,951个素纽结原型(交叉数3至19)的858,318张图像语料,与一套以Regina的规范纽结签名核对答案的协议相结合。其14个任务横跨四个类别:等价判断、移动预测、识别和跨模态接地;图像与符号的对分设计将失败定位于感知-操作鸿沟之上。我们在两家厂商对齐的64K输出token预算下评测Claude Opus 4.7和GPT-5,各自包含开启与关闭思考两种模式。在56个(任务,模型)组合中,15个处于随机基线或更低,14个任务中有8个的最佳得分低于随机的1.5倍。在图到符号的转写上,没有任何模型产出严格正确的字符串,宽松的Regina解码也只能在100个条目中恢复0至4个纽结。思考模式使Claude的总体准确率提升1.65分、GPT-5提升9.25分,仅小幅缩小差距。综合来看,四个类别共同表明,当前的视觉语言模型持有绳结图的特征,却缺乏在这些特征上模拟移动的机制。

VLM的戈尔迪之结:作为高难基准的绳结图推理:论文配图
图 1:KnotBench 结果概览。行是我们评估的四种视觉语言模型;栏目为14项评估任务;任务颜色是冷暖尺度上的准确性。木炭盒的最先进准确度达到或低于 65%。大多数行中的大多数任务都远低于白色中线,该中线对应于二进制任务的随机基线。