论文
VLM的戈尔迪之结:作为高难基准的绳结图推理
The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark
摘要
视觉语言模型可以看着绳结图并报告所见内容,却无法对该结构进行操作。KnotBench将来自1,951个素纽结原型(交叉数3至19)的858,318张图像语料,与一套以Regina的规范纽结签名核对答案的协议相结合。其14个任务横跨四个类别:等价判断、移动预测、识别和跨模态接地;图像与符号的对分设计将失败定位于感知-操作鸿沟之上。我们在两家厂商对齐的64K输出token预算下评测Claude Opus 4.7和GPT-5,各自包含开启与关闭思考两种模式。在56个(任务,模型)组合中,15个处于随机基线或更低,14个任务中有8个的最佳得分低于随机的1.5倍。在图到符号的转写上,没有任何模型产出严格正确的字符串,宽松的Regina解码也只能在100个条目中恢复0至4个纽结。思考模式使Claude的总体准确率提升1.65分、GPT-5提升9.25分,仅小幅缩小差距。综合来看,四个类别共同表明,当前的视觉语言模型持有绳结图的特征,却缺乏在这些特征上模拟移动的机制。
