论文

TangramSR:视觉语言模型能在连续几何空间中推理吗?

TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?

模型推理推理验证与自校正

摘要

人类擅长七巧板拼装等空间推理任务,其认知过程涉及心理旋转、迭代修正和视觉反馈。受人类通过试错、观察与修正来解七巧板谜题的启发,我们设计了一个对这些人类认知机制进行建模的框架。然而,针对五个代表性视觉语言模型(VLM)的全面实验揭示了连续几何推理中的系统性失败:单块任务的平均IoU仅为0.41,两块拼合降至0.23,远低于人类表现——连儿童都能成功完成七巧板任务。本文研究自我改进AI中的一个根本性挑战:模型能否在不更新参数的情况下在测试时迭代修正其预测?我们提出一个测试时自我修正框架,将上下文学习(ICL)与奖励引导的反馈回路相结合,其灵感来自人类认知过程。我们的免训练验证器-修正器智能体应用递归修正回路,基于几何一致性反馈迭代地自我修正预测,在中等三角形案例上将IoU从0.63提升至0.932,且无需任何模型再训练。这表明,通过ICL和奖励回路引入受人类启发的迭代修正机制,可以大幅增强VLM的几何推理能力,使自我改进AI在连续空间领域从承诺走向实践。我们的工作见此匿名链接 https://anonymous.4open.science/r/TangramVLM-F582/。

TangramSR:视觉语言模型能在连续几何空间中推理吗?
图1:从SVG → \rightarrow JSON → \rightarrow PNG → \rightarrow 任务划分的总体数据集构建流水线。该图展示了原始SVG七巧板轮廓如何被解析为JSON标注(类型、位置、角度、大小),渲染为训练/评估图像,并划分为单块、双块或完整七巧板子集。