论文
借助构造思考:视觉—文本交错几何推理的基准与策略优化
Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning
摘要
几何推理本质上需要“借助构造思考”——动态操作视觉辅助以弥合问题条件与解之间的差距。然而,现有多模态大语言模型(MLLM)大多局限于使用静态图的被动推理,缺乏关于何时以及如何构造有效视觉辅助的策略知识。为此,我们提出视觉—文本交错思维链框架。我们首先引入 GeoAux-Bench,首个包含4,334道几何题的基准,将文本构造步骤与金标准视觉更新对齐。我们的先导研究揭示两点关键洞见:(1) 交错的视觉—文本辅助优于单模态对应物,后者无法无损捕捉几何协同性;(2) 有效构造起到熵减作用,与推理困惑度的降低强相关。基于这些发现,我们提出动作适用性策略优化(A2PO),一个掌握策略性构造的强化学习范式。A2PO 采用自适应奖励塑形(Adaptive Reward Shaping),通过反事实采样调节视觉辅助的时机与质量,以区分必要与冗余的构造。实验表明,我们的方法使 MLLM 能够利用选择性的辅助构造,较强劲基线提升3.51%。代码与数据已在 GitHub 提供。
