论文

借助构造思考:视觉—文本交错几何推理的基准与策略优化

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

模型训练强化学习Agentic RL

摘要

几何推理本质上需要“借助构造思考”——动态操作视觉辅助以弥合问题条件与解之间的差距。然而,现有多模态大语言模型(MLLM)大多局限于使用静态图的被动推理,缺乏关于何时以及如何构造有效视觉辅助的策略知识。为此,我们提出视觉—文本交错思维链框架。我们首先引入 GeoAux-Bench,首个包含4,334道几何题的基准,将文本构造步骤与金标准视觉更新对齐。我们的先导研究揭示两点关键洞见:(1) 交错的视觉—文本辅助优于单模态对应物,后者无法无损捕捉几何协同性;(2) 有效构造起到熵减作用,与推理困惑度的降低强相关。基于这些发现,我们提出动作适用性策略优化(A2PO),一个掌握策略性构造的强化学习范式。A2PO 采用自适应奖励塑形(Adaptive Reward Shaping),通过反事实采样调节视觉辅助的时机与质量,以区分必要与冗余的构造。实验表明,我们的方法使 MLLM 能够利用选择性的辅助构造,较强劲基线提升3.51%。代码与数据已在 GitHub 提供。

借助构造思考:视觉—文本交错几何推理的基准与策略优化:论文配图
图 1:GeoAux-Bench 的代表性样本。解决方案轨迹采用视觉文本交错格式构建:文本辅助构造步骤(例如 <aux>... </aux>)与相应的辅助图 (Ia​u​xI_{aux}) 显式配对。